Multimodal LLM

Vision, audio, video generation, and multimodal LLM integration patterns. Use when processing images, transcribing audio, generating speech, generating AI video (Kling v3, Sora 2, Veo 3.1 std/lite/fast, Runway Gen-4.5 via `gen4_turbo`), or building multimodal AI pipelines.

yonatangross 526c522 13 files · 47.0 KB Updated

File contents

yonatangross/orchestkit/tree/main/src/skills/multimodal-llm commit 526c522aa1

Frequently asked questions

npx skillmds add yonatangross/multimodal-llm