Omnimedia

Multimodal AI - Gemini for analysis (vision/transcribe/OCR/extract); image generation via Codex (ChatGPT subscription), Gemini/Imagen, OpenRouter, MiniMax; video, speech, music via Gemini + MiniMax. Use when the user asks to analyze, transcribe, OCR, or describe an image/audio/video/document, or to generate an image, video, voiceover, or music.

vanducng 0eb2926 31 files · 317.4 KB Updated

File contents

vanducng/skills/tree/main/skills/omnimedia commit 0eb2926e50

Frequently asked questions

npx skillmds@latest add vanducng/omnimedia