AI Multimodal

Process and generate multimedia content using Google Gemini API. Capabilities include analyze audio files (transcription with timestamps, summarization, speech understanding, music/sound analysis up to 9.5 hours), understand images (captioning, object detection, OCR, visual Q&A, segmentation), pr...

JantonioFC Updated 6 repo stars

File contents

JantonioFC/skillsbank/tree/main/skills/ai-multimodal commit 7b04346813

Frequently asked questions

npx skillmds@latest add jantoniofc/ai-multimodal