# Vision Language Models

> Vision-language models, multimodal AI, and visual reasoning

- Skill: `neuralblitz/vision-language-models` (Agent Skill)
- Install (CLI): `npx skillmds@latest add neuralblitz/vision-language-models`
- Raw SKILL.md: https://api.skillmd.com/api/skills/neuralblitz/vision-language-models/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- License: MIT
- Author: NeuralBlitz (https://skillmd.com/u/neuralblitz)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/neuralblitz/vision-language-models

---


## What I do
- Build vision-language models
- Work with CLIP, BLIP, LLaVA
- Perform visual question answering
- Create multimodal chatbots

## When to use me
When building systems that combine vision and language.

## Key Concepts
- CLIP
- BLIP and BLIP-2
- LLaVA
- Visual instruction tuning
- Cross-modal attention
- Image-text matching
- Multimodal reasoning

