Vision Language Models

Vision-language models, multimodal AI, and visual reasoning

NeuralBlitz 8d107a2 485 B Updated 1 repo stars

File contents

What I do

  • Build vision-language models
  • Work with CLIP, BLIP, LLaVA
  • Perform visual question answering
  • Create multimodal chatbots

When to use me

When building systems that combine vision and language.

Key Concepts

  • CLIP
  • BLIP and BLIP-2
  • LLaVA
  • Visual instruction tuning
  • Cross-modal attention
  • Image-text matching
  • Multimodal reasoning

neuralblitz/mito/tree/main/.opencode/skills/vision-language-models commit 8d107a2b3d

Frequently asked questions

npx skillmds@latest add neuralblitz/vision-language-models