# Agent Speak

> Give agents voice abilities using `rawgenai` — text-to-speech, multi-speaker dialogue, and voice management (design, clone, create voices). Use this skill when the user asks to "speak", "talk", "read aloud", "say this", "create dialogue", "design a voice", "clone a voice", or any request involving spoken audio output and voice creation.

- Skill: `whq25/agent-speak` (Agent Skill, multi-file: 21 files)
- Install (CLI): `npx skillmds@latest add whq25/agent-speak`
- Raw SKILL.md: https://api.skillmd.com/api/skills/whq25/agent-speak/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: whq25 (https://skillmd.com/u/whq25)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/whq25/agent-speak

---


# Agent Speak

Use `rawgenai <provider> tts` to speak, `rawgenai <provider> dialogue` for multi-speaker audio, and `rawgenai <provider> voice` to manage voices. Always read the chosen provider's reference file before running commands.

## Prerequisites

```bash
brew install WHQ25/tap/rawgenai
```

Before using a provider, read its setup guide at [references/setup/](references/setup/) to configure credentials.

## Input Sources

1. Positional argument: `rawgenai <provider> tts "text" [flags]`
2. File: `rawgenai <provider> tts --file input.txt [flags]`
3. Stdin: `echo "text" | rawgenai <provider> tts [flags]`

## General Guidelines

- On first use, ask user to pick a **provider**. Remember for the session.
- All output is JSON. Always show file paths to the user.
- For TTS: write natural conversational text, not markdown. Use `--speak` for playback, `-o` for file.
- If a command fails, try a different provider or inform the user.

---

## Speak (TTS)

`rawgenai <provider> tts "<text>" --speak`

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **OpenAI** | `rawgenai openai tts` | General purpose, English | [ref](references/speak/openai.md) |
| **Google Gemini** | `rawgenai google tts` | Expressive storytelling, multi-speaker | [ref](references/speak/google.md) |
| **ElevenLabs** | `rawgenai elevenlabs tts` | Most natural voices, 70+ languages | [ref](references/speak/elevenlabs.md) |
| **Seed** | `rawgenai seed tts` | Chinese, emotion-rich | [ref](references/speak/seed.md) |
| **DashScope** | `rawgenai dashscope tts` | Chinese, 10 languages, 49 voices | [ref](references/speak/dashscope.md) |
| **MiniMax** | `rawgenai minimax tts` | Chinese, streaming | [ref](references/speak/minimax.md) |
| **Kling** | `rawgenai kling tts` | Bilingual zh/en | [ref](references/speak/kling.md) |
| **Runway** | `rawgenai runway audio tts` | Async | — |

---

## Dialogue

Multi-speaker dialogue from JSON script (max 10 voices).

| Provider | Command | Reference |
|----------|---------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs dialogue -i script.json -o out.mp3` | [ref](references/dialogue/elevenlabs.md) |

---

## Voice Management

Design, clone, and manage custom voices.

| Provider | Command | Capabilities | Reference |
|----------|---------|-------------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs voice` | list, design, create, preview | [ref](references/voice/elevenlabs.md) |
| **Kling** | `rawgenai kling voice` | create, status, list, delete | [ref](references/voice/kling.md) |
| **MiniMax** | `rawgenai minimax voice` | list, upload, clone, design, delete | [ref](references/voice/minimax.md) |
| **Seed** | `rawgenai seed voice-clone` | upload, status, order, renew | [ref](references/voice/seed.md) |

