Qformer Multimodal Feature Alignment

Bridges frozen vision encoders and LLMs for multimodal image captioning and reasoning.

robertoatila Updated

File contents

robertoatila/jarvis-skill-registry/tree/main/skills/qformer-multimodal-feature-alignment commit 73c6a59268

Frequently asked questions

npx skillmds@latest add robertoatila/qformer-multimodal-feature-alignment