Clip

Runs OpenAI CLIP for zero-shot image classification, image-text cosine matching, semantic search, and cross-modal retrieval in a shared embedding space. Use when labeling images without training, ranking images by a text query, or scoring vision-language similarity. Not for captioning (BLIP-2), conversational VLM chat (LLaVA), or pixel-level segmentation (SAM); never skip L2-normalizing embeddings before cosine scores.

Kayforkind c8859cf 2 files · 15.1 KB Updated

File contents

Kayforkind/skill-slice commit c8859cf0ef

Frequently asked questions

npx skillmds@latest add kayforkind/clip