# Seed Audio

> 用自然语言描述生成目标音频。把一段场景描述（人声对话、环境声、音效、背景音乐等复合音频）一次性生成成音频。当用户描述一个声音场景、要求生成/合成/制作一段音频或声音、给出形如"角色：台词"的对话脚本要转成音频、或要按参考音频的音色说话时使用。支持两种模式：纯文本描述生成（T2A）和带参考音频生成（A2A，在描述中引用参考音频指定角色音色）

- Skill: `ahang1598/seed-audio` (Agent Skill, multi-file: 3 files)
- Install (CLI): `npx skillmds add ahang1598/seed-audio`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ahang1598/seed-audio/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: ahang1598 (https://skillmd.com/u/ahang1598)
- Updated: 2026-08-19
- Page: https://skillmd.com/skills/ahang1598/seed-audio

---


# seed-audio 使用指南

用自然语言描述一段目标音频，直接生成音频结果。描述可以简单到一句台词，也可以复杂到包含环境声、背景音乐、多角色对话、音效的完整场景。

!! 注意：把最终返回给用户的音频 URL 直接用 `NotifyHuman` 工具交付给用户，绝对不要下载到本地

## 两种模式

| 模式 | 何时使用                       | Skill                    |
| ---- | ------------------------------ | ------------------------ |
| T2A  | 描述里**没有任何参考音频指代** | [T2A](references/T2A.md) |
| A2A  | 描述里**有参考音频指代**       | [A2A](references/A2A.md) |

判定规则：扫一遍用户给出的音频描述，只要出现任何形式的参考音频指代（`@音频N`、「参考音频 1」「第一个音频」「附件 1」、或用附件文件名如「用麻雀的」引用等）就走 A2A，否则走 T2A。

## 意图识别

用户的输入通常是「意图前缀 + 音频描述」两部分。常见前缀形式：

- `给我生成一段声音/音频：{{音频描述}}`
- `按照以下要求，生成声音/音频：{{音频描述}}`
- `帮我合成/制作一段音频：{{音频描述}}`
- `把下面这段变成声音：{{音频描述}}`
- 直接给出音频描述，没有前缀

构造 tool input 的 `prompt` 时，**只保留音频描述本体，去掉其他无关内容**。例如用户输入「给我生成一段声音：男性 (青年): "你好呀！"」，传给 tool 的 `prompt` 应为 `男性(青年): "你好呀!"`。

## 通用原则

### 要做

- **原样保留用户描述**：用户给的音频描述（角色设定、环境描写、台词等）整体作为 `prompt`，不改写、不补全、不翻译、不重排。
- **复杂场景单次调用**：无论描述多长、包含多少角色和环境音，整段作为一个 `prompt` 一次调用，不要按角色或场景拆成多次调用。
- **只剥离与音频描述无关的内容**：用户输入里「给我生成一段音频」「按照以下要求」这类与音频内容无关的部分要去掉，其他与音频描述相关的文字一律保留。
- **以最长匹配构造 `prompt`**：尽量把更像音频描述的文字保留进 `prompt`，只把明显是描述边界外的其余内容拆出 `prompt`；对于时长，如果用户有指定时长的话，我们是应该从意图中提取时长的值，但时长本身也可以是提示词的一部分，而不是成为音频描述的硬分界符。

### 不要做

- **不要篡改或润色用户描述**：不要把「青年男性」改成「年轻男子」、不要把台词改写得更通顺、不要补充用户没说的环境细节或情绪标注。
- **不要拆分调用**：多角色对话、多段场景不要拆成多次 tool 调用再拼接，一次性把整段描述传给 tool。
- **不要自作主张补充参数**：严格遵循各 tool 的入参定义，只传 tool 明确要求的字段，不自行添加任何额外字段。
- **不要处理与生成音频无关的请求**：音色克隆注册等场景不归本 skill

