# Agent Right Brain

> Give agents creative abilities using `rawgenai` — speak, listen, generate images/videos/music/sound effects, create multi-speaker dialogue, and manage voices. Use this skill when the user asks to "speak", "talk", "read aloud", "transcribe", "generate an image", "create a picture", "draw", "edit an image", "generate a video", "create a video", "animate", "generate music", "create a song", "generate sound effects", "create dialogue", "design a voice", "clone a voice", or any request involving voice, audio, image, or video creation.

- Skill: `whq25/agent-right-brain` (Agent Skill, multi-file: 45 files)
- Install (CLI): `npx skillmds@latest add whq25/agent-right-brain`
- Raw SKILL.md: https://api.skillmd.com/api/skills/whq25/agent-right-brain/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: whq25 (https://skillmd.com/u/whq25)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/whq25/agent-right-brain

---


# Agent Right Brain

Use `rawgenai <provider> <action>` to give agents creative abilities. Always read the chosen provider's reference file before running commands.

## Prerequisites

```bash
brew install WHQ25/tap/rawgenai
```

Before using a provider, read its setup guide at [references/setup/](references/setup/) to configure credentials.

## Input Sources (All Capabilities)

1. Positional argument: `rawgenai <provider> <action> "text" [flags]`
2. File: `rawgenai <provider> <action> --file input.txt [flags]`
3. Stdin: `echo "text" | rawgenai <provider> <action> [flags]`

## General Guidelines

- On first use of a capability, ask user to pick a **provider**. Remember for the session.
- All output is JSON. Always show file paths to the user.
- For async commands (video, some image/audio): `create` -> `status` -> `download`.
- If a command fails, try a different provider or inform the user.
- Write image/video prompts descriptively: subject + action + environment + style + lighting.
- For TTS: write natural conversational text, not markdown. Use `--speak` for playback, `-o` for file.

---

## Speak (TTS)

`rawgenai <provider> tts "<text>" --speak`

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **OpenAI** | `rawgenai openai tts` | General purpose, English | [ref](references/speak/openai.md) |
| **Google Gemini** | `rawgenai google tts` | Expressive storytelling, multi-speaker | [ref](references/speak/google.md) |
| **ElevenLabs** | `rawgenai elevenlabs tts` | Most natural voices, 70+ languages | [ref](references/speak/elevenlabs.md) |
| **Seed** | `rawgenai seed tts` | Chinese, emotion-rich | [ref](references/speak/seed.md) |
| **DashScope** | `rawgenai dashscope tts` | Chinese, 10 languages, 49 voices | [ref](references/speak/dashscope.md) |
| **MiniMax** | `rawgenai minimax tts` | Chinese, streaming | [ref](references/speak/minimax.md) |
| **Kling** | `rawgenai kling tts` | Bilingual zh/en | [ref](references/speak/kling.md) |
| **Runway** | `rawgenai runway audio tts` | Async | — |

---

## Listen (STT)

`rawgenai <provider> stt <audio-file>`

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **OpenAI** | `rawgenai openai stt` | Subtitles (srt/vtt) | [ref](references/stt/openai.md) |
| **Google Gemini** | `rawgenai google stt` | Speaker diarization | [ref](references/stt/google.md) |
| **ElevenLabs** | `rawgenai elevenlabs stt` | Large files (3GB), video input | [ref](references/stt/elevenlabs.md) |
| **DashScope** | `rawgenai dashscope stt` | Chinese, emotion, long audio (12h async) | [ref](references/stt/dashscope.md) |

---

## Image

`rawgenai <provider> image "<prompt>" -o output.png`

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **OpenAI** | `rawgenai openai image` | Transparent bg, editing, multi-turn | [ref](references/image/openai.md) |
| **Google Gemini** | `rawgenai google image` | 4K, text in image | [ref](references/image/google.md) |
| **Grok** | `rawgenai grok image` | Batch (up to 10) | [ref](references/image/grok.md) |
| **Seed** | `rawgenai seed image` | 4K, multi-image fusion | [ref](references/image/seed.md) |
| **DashScope** | `rawgenai dashscope image` | Text rendering, Chinese | [ref](references/image/dashscope.md) |
| **MiniMax** | `rawgenai minimax image` | Subject reference | [ref](references/image/minimax.md) |
| **Kling** | `rawgenai kling image` | Face reference (async) | [ref](references/image/kling.md) |
| **Luma** | `rawgenai luma image` | Creative, reframe (async) | — |
| **Hunyuan** | `rawgenai hunyuan image` | Chinese (async) | — |
| **Runway** | `rawgenai runway image` | Cinematic (async) | — |

---

## Video

`rawgenai <provider> video create "<prompt>" [flags]` → `status <id>` → `download <id> -o out.mp4`

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **OpenAI (Sora)** | `rawgenai openai video` | Remix | [ref](references/video/openai.md) |
| **Google (Veo)** | `rawgenai google video` | 4K, extension | [ref](references/video/google.md) |
| **Grok** | `rawgenai grok video` | Quick, editing | [ref](references/video/grok.md) |
| **Seed** | `rawgenai seed video` | Audio, wide ratios | [ref](references/video/seed.md) |
| **DashScope** | `rawgenai dashscope video` | Character ref, multi-shot | [ref](references/video/dashscope.md) |
| **MiniMax (Hailuo)** | `rawgenai minimax video` | Subject ref, director modes | [ref](references/video/minimax.md) |
| **Kling** | `rawgenai kling video` | Most advanced, element system | [ref](references/video/kling.md) |
| **Luma** | `rawgenai luma video` | Extension, upscale | — |
| **Hunyuan** | `rawgenai hunyuan video` | Chinese | — |
| **Runway** | `rawgenai runway video` | Cinematic, character ref | — |

---

## Music

| Provider | Command | Best For | Reference |
|----------|---------|----------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs music` | Prompt-based, composition plans | [ref](references/music/elevenlabs.md) |
| **MiniMax** | `rawgenai minimax music create` | Lyrics-to-music, Chinese | [ref](references/music/minimax.md) |

---

## Sound Effects (SFX)

| Provider | Command | Reference |
|----------|---------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs sfx "<prompt>" -o out.mp3` | [ref](references/sfx/elevenlabs.md) |
| **Runway** | `rawgenai runway audio sfx "<prompt>"` | — |

---

## Dialogue

Multi-speaker dialogue from JSON script (max 10 voices).

| Provider | Command | Reference |
|----------|---------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs dialogue -i script.json -o out.mp3` | [ref](references/dialogue/elevenlabs.md) |

---

## Voice Management

Design, clone, and manage custom voices.

| Provider | Command | Capabilities | Reference |
|----------|---------|-------------|-----------|
| **ElevenLabs** | `rawgenai elevenlabs voice` | list, design, create, preview | [ref](references/voice/elevenlabs.md) |
| **Kling** | `rawgenai kling voice` | create, status, list, delete | [ref](references/voice/kling.md) |
| **MiniMax** | `rawgenai minimax voice` | list, upload, clone, design, delete | [ref](references/voice/minimax.md) |
| **Seed** | `rawgenai seed voice-clone` | upload, status, order, renew | [ref](references/voice/seed.md) |

---

## Audio Processing

Async: `rawgenai runway audio <action>` → `status <id>` → `download <id> -o out`

| Provider | Command | Capability |
|----------|---------|------------|
| **Runway** | `rawgenai runway audio sts` | Speech-to-speech (voice conversion) |
| **Runway** | `rawgenai runway audio dubbing` | Dub audio to another language |
| **Runway** | `rawgenai runway audio isolation` | Isolate voice from background |

