What I do
- Build models that process multiple modalities
- Work with vision-language models
- Align different data types
- Fuse multimodal representations
When to use me
When working on multimodal AI or vision-language systems.
Key Concepts
- Vision-language models
- Cross-modal attention
- Representation learning
- CLIP
- Image captioning
- Visual question answering
- Audio-visual learning