seed-audio 使用指南
用自然语言描述一段目标音频,直接生成音频结果。描述可以简单到一句台词,也可以复杂到包含环境声、背景音乐、多角色对话、音效的完整场景。
两种模式
| 模式 | 何时使用 | Skill |
|---|---|---|
| T2A | 描述里没有任何参考音频指代 | T2A |
| A2A | 描述里有参考音频指代 | A2A |
判定规则:扫一遍用户给出的音频描述,只要出现任何形式的参考音频指代(@音频N、「参考音频 1」「第一个音频」「附件 1」、或用附件文件名如「用麻雀的」引用等)就走 A2A,否则走 T2A。
意图识别
用户的输入通常是「意图前缀 + 音频描述」两部分。常见前缀形式:
给我生成一段声音/音频:{{音频描述}}按照以下要求,生成声音/音频:{{音频描述}}帮我合成/制作一段音频:{{音频描述}}把下面这段变成声音:{{音频描述}}- 直接给出音频描述,没有前缀
构造 tool input 的 prompt 时,只保留音频描述本体,去掉其他无关内容。例如用户输入「给我生成一段声音:男性 (青年): "你好呀!"」,传给 tool 的 prompt 应为 男性(青年): "你好呀!"。
通用原则
要做
- 原样保留用户描述:用户给的音频描述(角色设定、环境描写、台词等)整体作为
prompt,不改写、不补全、不翻译、不重排。 - 复杂场景单次调用:无论描述多长、包含多少角色和环境音,整段作为一个
prompt一次调用,不要按角色或场景拆成多次调用。 - 只剥离与音频描述无关的内容:用户输入里「给我生成一段音频」「按照以下要求」这类与音频内容无关的部分要去掉,其他与音频描述相关的文字一律保留。
- 以最长匹配构造
prompt:尽量把更像音频描述的文字保留进prompt,只把明显是描述边界外的其余内容拆出prompt;对于时长,如果用户有指定时长的话,我们是应该从意图中提取时长的值,但时长本身也可以是提示词的一部分,而不是成为音频描述的硬分界符。
不要做
- 不要篡改或润色用户描述:不要把「青年男性」改成「年轻男子」、不要把台词改写得更通顺、不要补充用户没说的环境细节或情绪标注。
- 不要拆分调用:多角色对话、多段场景不要拆成多次 tool 调用再拼接,一次性把整段描述传给 tool。
- 不要自作主张补充参数:严格遵循各 tool 的入参定义,只传 tool 明确要求的字段,不自行添加任何额外字段。
- 不要处理与生成音频无关的请求:音色克隆注册等场景不归本 skill