Audio Language Models

Gemini Live API, Grok Voice Agent, GPT-4o-Transcribe, AssemblyAI patterns for real-time voice, speech-to-text, and TTS. Use when implementing voice agents, audio transcription, or conversational AI.

majiayu000 f0a105b 2 files · 11.8 KB Updated 567 repo stars

File contents

majiayu000/claude-skill-registry-data/tree/main/ai-llm/audio-language-models commit f0a105bfe9

Frequently asked questions

npx skillmds add majiayu000/audio-language-models