Q Multimodal

Extract visual, video, and audio features from media. Use for pixel features (Pillow), video frames (FFmpeg+Pillow), speech/audio features (openSMILE), music features (librosa), and visual semantic analysis (Gemini API batch or standard).

tyrealq 9caa6b1 23 files · 250.8 KB Updated

File contents

tyrealq/q-skills/tree/main/skills/q-scholar/q-multimodal commit 9caa6b1e9f

Frequently asked questions

npx skillmds@latest add tyrealq/q-multimodal