Vision Language Models

Run VLM inference (Qwen2-VL, LLaVA, CLIP) via Transformers: captioning, VQA, zero-shot classification, chart data extraction. Use when captioning images, answering visual questions, or classifying images with no labels.

pavel-kravchenko cc6a1f2 7.2 KB Updated

File contents

pavel-kravchenko/bioinformatics/tree/main/Skills/vision-language-models commit cc6a1f2c1e

Frequently asked questions

npx skillmds@latest add pavel-kravchenko/vision-language-models