Multimodal RAG

Retrieval over images, PDFs with figures and tables, audio, and video. Vision-language embeddings (CLIP, SigLIP, ImageBind, VoyageAI multimodal, BGE-M3), vision-model ingestion (Claude Vision, GPT-4o Vision), table-aware retrieval, Whisper-based audio RAG, keyframe + transcript video RAG. USE WHEN: user mentions "multimodal RAG", "image search", "PDF with figures", "table extraction", "audio RAG", "video RAG", "CLIP", "SigLIP", "VoyageAI multimodal", "BGE-M3", "Claude Vision RAG", "GPT-4o Vision" DO NOT USE FOR: pure text RAG - use `rag-patterns`; graph reasoning - use `graph-rag`; grounding/citation enforcement - use `rag-guardrails`

claude-dev-suite Updated 28 repo stars

File contents

claude-dev-suite/claude-dev-suite/tree/main/skills/rag/multimodal-rag commit c3b5eb5de7

Frequently asked questions

npx skillmds@latest add claude-dev-suite/multimodal-rag