# Audio Domain

> 音频领域路由器（占位符）— 待扩展。 计划覆盖：音乐创作 / 播客制作 / 声音设计 / 音效合成。 当前状态：规划中，等待AI音频生成技术进一步成熟。

- Skill: `shenweihuan/audio-domain` (Agent Skill)
- Install (CLI): `npx skillmds@latest add shenweihuan/audio-domain`
- Raw SKILL.md: https://api.skillmd.com/api/skills/shenweihuan/audio-domain/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: shenweihuan (https://skillmd.com/u/shenweihuan)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/shenweihuan/audio-domain

---


# 🎵 音频领域 — Audio Domain

> **⚠️ 本领域当前为占位状态，正在规划和建设中。**
> **音频创作是AIGC Creative Skills v3的下一个重要扩展方向。**

---

## 当前状态：🚧 规划中 (Planned)

```
┌─────────────────────────────────────────────────────────────┐
│                                                             │
│                    🎵 音频领域                               │
│                                                             │
│                   ⚠️  COMING SOON ⚠️                        │
│                                                             │
│   本领域正在积极规划中，预计在以下条件成熟后正式开放：         │
│                                                             │
│   ✅ AI音乐生成技术达到可用水平                              │
|   ✅ AI语音合成质量满足专业需求                              │
|   ✅ 完成足够的大师级品味框架研究                             │
|   ✅ 构建完整的感知训练体系                                   │
│                                                             │
│   预计时间窗口：2026-2027年                                  │
│                                                             │
└─────────────────────────────────────────────────────────────┘
```

---

## 为什么音频领域还在"占位"？

### 技术成熟度评估

与其他四个领域的对比：

| 领域 | AI技术成熟度 | 可用性 | v3 覆盖状态 |
|------|------------|-------|------------|
| **视觉艺术** | ★★★★★ (非常成熟) | Midjourney/DALL-E/SD 已广泛使用 | ✅ 完成 (12个技能) |
| **写作文学** | ★★★★★ (非常成熟) | ChatGPT/Claude 已达到专业水平 | ✅ 完成 (9个技能) |
| **影视视频** | ★★★★☆ (快速进步中) | Seedance/Runway/Kling 可用于片段 | ✅ 完成 (7个技能) |
| **设计** | ★★★★☆ (成熟) | 图像生成 + 设计工具链完善 | ✅ 完成 (6个技能) |
| **音频** | ★★★☆☆ (发展中) | 音乐/语音有突破但未达"大师协作"级别 | 🚧 占位 |

### 音频创作的特殊挑战

```
1. 时间维度的复杂性
   - 音乐是多轨时间流的精确同步
   - 比视频更抽象（没有视觉锚点）
   - 结构和和声需要深层理解

2. 主观性更强
   - "好听"比"好看"更难定义
   - 文化和个人偏好差异巨大
   - 缺乏通用的"评价标准"

3. 技术限制
   - AI音乐生成的连贯性和可控性仍有限
   - 语音合成的情感表达不够自然
   - 音效设计的精确控制困难
   - 多轨混音的AI自动化程度低

4. 版权和法律问题
   - AI训练数据的版权争议更大（音乐产业保护意识强）
   - 声音克隆的伦理问题
   - 商业使用的法律边界不清晰
```

---

## 计划中的方向（Roadmap）

尽管尚未正式开放，我们已经完成了初步规划。以下是计划覆盖的方向：

### 🎼 一级子目录规划

```
domains/audio/
├── music/                  # 音乐创作
│   ├── classical/          # 古典音乐方向
│   │   ├── bach-counterpoint  # 巴赫·对位法
│   │   └── romantic-piano     # 浪漫派钢琴
│   ├── modern/             # 现代音乐方向
│   │   ├── jazz-improv        # 爵士即兴
│   │   ├── electronic-ambient # 电子氛围
│   │   └── rock-production    # 摇滚制作
│   └── film-score          # 电影配乐
│       ├── hans-zimmer-epic   # 汉斯·季默·史诗配乐
│       └── piano-melancholy   # 忧郁钢琴（久石让风格）
│
├── podcasting/            # 播客与有声内容
│   ├── narrative-storytelling  # 叙事型播客
│   └── interview-conversation  # 对话型播客
│
├── sound-design/          # 声音设计
│   ├── foley-artistry        # 拟音艺术
│   └── atmospheric-soundscape # 氛围声景
│
└── voice/                 # 语音与合成
    ├── tts-narration         # 有声书/旁白
    └── vocal-synthesis       # 歌声合成
```

### 📋 计划中的原子技能（首批）

#### 音乐创作 Music (`music/`)

| 计划技能名 | 大师/风格 | 预期定位 | 关键挑战 |
|-----------|----------|---------|---------|
| `bach-counterpoint` | J.S.巴赫 · 对位法 | 复调音乐的逻辑之美 | AI需要理解和声/复调理论 |
| `romantic-chopin` | 肖邦 · 浪漫派钢琴 | 情感的极致表达 | 需要捕捉演奏的细微动态 |
| `jazz-miles-davis` | 迈尔斯·戴维斯 · 爵士即兴 | 即兴的艺术 | 即兴性的AI模拟极难 |
| `electronic-brian-eno` | 布莱恩·伊诺 · 氛围音乐 | 生成系统与偶然性 | 可能是最适合AI的音乐类型 |
| `film-score-hans-zimmer` | 汉斯·季默 · 史诗配乐 | 情绪的管弦乐工程 | 多轨编排的复杂性 |
| `anime-joe-hisaishi` | 久石让 · 动画配乐 | 旋律的记忆点 | 与视觉叙事的配合 |

#### 播客 Podcasting (`podcasting/`)

| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|-----------|------|---------|---------|
| `narrative-this-american-life` | 叙事型播客（This American Life式） | 用声音讲故事 | 声音剪辑的艺术 |
| `conversation-joe-rogan` | 对话型播客（长对话式） | 对话的能量管理 | 自然对话的节奏感 |

#### 声音设计 Sound Design (`sound-design/`)

| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|-----------|------|---------|---------|
| `foley-classic` | 经典拟音 | 用日常物品创造世界 | 创造力和拟音技巧 |
| `soundscape-nature` | 自然声景 | 环境音的氛围营造 | 层次感和空间感 |

#### 语音 Voice (`voice/`)

| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|-----------|------|---------|---------|
| `audiobook-calm` | 平静叙述型有声书 | 沉浸式阅读体验 | 情感表达的微妙控制 |
| `character-voice` | 角色配音 | 多角色声音塑造 | 声音的一致性和辨识度 |

---

## 临时替代方案（当前可用的音频相关能力）

虽然本领域尚未正式开放，但你仍然可以通过以下方式处理音频相关的创作需求：

### 方案1：跨域借用（推荐）

```
如果你需要：
→ 背景音乐建议 → 使用 film-video/ 的技能（电影配乐部分会涉及音乐讨论）
→ 声音氛围描述 → 使用 writing/ 的技能（用文字描述声音场景）
→ 歌词创作 → 使用 poetry/ 或 prose/ 的技能（文字是声音的基础）
→ 播客脚本 → 使用 screenplay/ 或 copywriting/ 的技能（结构化写作）
```

### 方案2：使用通用AI工具

当前可用的AI音频工具（非本系统集成）：

| 工具类型 | 代表产品 | 适用场景 | 局限性 |
|---------|---------|---------|-------|
| AI音乐生成 | Suno / Udio / Google MusicLM | 短片段背景音乐/实验 | 风格控制粗糙，难以精调 |
| AI语音合成 | ElevenLabs / Azure TTS / ChatTTS | 有声书/配音/播客 | 情感表达仍不够自然 |
| AI音效 | AudioLDM / Stable Audio | 音效素材生成 | 控制精度低 |
| AI歌词辅助 | ChatGPT / Claude | 歌词创作 | 无旋律配合能力 |

### 方案3：传统工作流 + AI辅助

```
对于严肃的音频项目，当前最佳实践仍是：

1. 人类创作核心（旋律/歌词/概念）
2. AI辅助：
   - 灵感生成（AI提供多个起点）
   - 编曲建议（和弦进行/配器方案）
   - 混音参考（AI分析参考曲目参数）
3. 人类最终决策和精细调整
4. 专业软件执行（DAW / 插件）

这不是"AI替代人类"，而是"AI加速人类的迭代过程"。
```

---

## 我们正在关注的技术进展

以下是判断"何时正式开放音频领域"的关键指标：

### 必须满足的门槛条件

```
□ AI音乐生成能够：
  ✓ 生成2分钟以上连贯的作品（不是15秒循环）
  ✓ 遵循指定的风格和情绪（不只是随机输出）
  ✓ 支持多轨分离编辑（人声/贝斯/鼓等独立控制）
  ✓ 允许精细的参数调整（速度/调性/乐器配置）
  ✓ 输出质量达到商业发布标准（或接近）

□ AI语音合成能够：
  ✓ 表达复杂的情感（不仅是"开心/悲伤"这种粗粒度）
  ✓ 维持长文本的一致性角色声音
  ✓ 支持自然的韵律和呼吸感
  ✓ 允许风格迁移（模仿特定演员/播音员的声音特征）
  ✓ 解决声音克隆的伦理和法律问题

□ AI音效设计能够：
  ✓ 根据描述生成准确的音效（不只是近似）
  ✓ 支持空间定位（立体声/环绕声/3D音频）
  ✓ 允许动态变化（不是静态样本）
  ✓ 与视频同步（自动匹配画面节奏）
```

### 正在密切跟踪的项目/技术

| 技术/公司 | 最新进展 | 对本系统的意义 |
|----------|---------|--------------|
| **Suno v3/v4** | 音乐生成质量和长度持续提升 | 可能成为音乐技能的首选平台 |
| **ElevenLabs Turbo** | 语音合成速度和质量提升 | 有望成为语音技能的基础设施 |
| **Google MusicLM / MusicFX** | 谷歌在音乐AI上的投入 | 技术验证的重要参考 |
| **Stable Audio (Stability AI)** | 开源音频模型 | 可能支持本地部署和定制化 |
| **Meta AudioCraft** | Meta的多功能音频模型 | 一站式音乐+音效+语音的可能性 |
| **Anthropic/GPT音频能力** | 大模型厂商进入音频领域 | 可能带来"语言+音频"的统一理解 |

---

## 你现在可以做什么？

### 如果你是音频创作者

```
1. 继续使用现有工具（上述"临时替代方案"）
2. 关注本领域的更新（我们会在总控 SKILL.md 中标注进度）
3. 参与我们社区的建设：
   - 分享你使用AI音频工具的经验
   - 提出你希望看到的技能方向
   - 协助测试未来的beta版本
4. 先从其他领域入手：
   - 学习 writing/ 的技能提升歌词/脚本能力
   - 学习 film-video/ 的技能理解视听配合
   - 这些都会在音频领域开放后成为你的优势
```

### 如果你是开发者/研究者

```
1. 如果你正在开发AI音频工具，我们很乐意合作：
   - 提供品味框架作为"上层指导"
   - 测试你的技术在真实创作场景的表现
   - 共同定义"AI音频大师"的工作模式

2. 如果你想贡献内容：
   - 音乐理论和美学的研究
   - 特定风格的深度分析（如：如何定义"爵士味"）
   - 感知训练方法的设计（如：如何训练耳朵）
   - 评价标准的建立（如：什么是"好的人声"）

3. 联系方式：通过主仓库 Issues 或 Discussions 提出
```

---

## 预览：音频领域的设计哲学（草案）

虽然还未实现，但我们已经形成了对音频领域的核心理解：

### 音频创作的本质

```
视觉艺术：空间的艺术（眼睛扫描平面/体积）
写作文学：时间的艺术（线性阅读）
影视视频：时空艺术（时间流中的空间呈现）
设计：解决问题的艺术（功能导向的美学）
音频：纯粹的时间艺术（无形、不可逆、直接作用于情感）

音频的特殊性：
✗ 没有视觉锚点（纯听觉体验）
✗ 不可逆的时间流（不能像绘画那样反复观看细节）
✗ 直接的情感通道（绕过理性思考，直达边缘系统）
✗ 物理性（声波是真实的物理振动，会引起生理反应）
✗ 文化的普遍性（音乐可能是最普世的"语言"）

因此，音频领域的技能设计必须：
1. 强调"时间感知训练"（比其他领域更重要）
2. 建立"情感映射系统"（音乐元素→情感反应的科学对应）
3. 发展"非视觉的想象力"（用耳朵"看到"声音的空间）
4. 尊重文化和个人差异（避免单一标准）
5. 与其他领域深度整合（尤其是film-video的视听配合）
```

### 计划中的AI音频大师

```
ai-audio-master（规划中）

核心能力：
- 全平台音频生成专家（Suno/Udio/ElevenLabs/AudioLDM）
- 音乐理论与提示词工程的桥梁
- 自动混音和母带处理引擎
- 多轨编排助手
- 声音设计顾问

工作模式（参考其他AI大师的四模式）：
A 教学模式：音乐理论基础/DAW操作指南/听音训练方法
B 评价模式：多维度音频评分/频率分析/动态范围诊断
C 工作流模式：完整音乐制作流程/播客生产管线/声音设计流程
D 自动迭代模式：生成→听评→修改→再生成的循环（针对音乐特别优化）

特殊挑战：
- 如何建立"音频版的自检清单"？（视觉可以截图对比，音频呢？）
- 如何量化"好听"？（主观性太强）
- 如何处理版权？（音乐产业的特殊性）
```

---

## 时间线展望（非承诺，仅供参考）

```
2025 Q3-Q4:
├── 完成本领域的详细规划文档
├── 开始构建第一批1-2个实验性技能（可能是electronic-ambient）
├── 建立音频感知训练的原型
└── 开启小范围内测

2026:
├── 如果技术达标：正式开放 music/ 的2-3个技能
├── 发布 ai-audio-master 的alpha版本
├── 开始 podcasting/ 和 sound-design/ 的建设
└── 收集用户反馈，快速迭代

2027:
├── 目标：达到与其他4个领域相当的覆盖度
├── 完整的6大领域协同工作流
└── AIGC Creative Skills v3 "完整版"
```

---

## 最后的话

> **音频是人类最古老的艺术形式之一——早在绘画之前，我们的祖先就在火堆旁歌唱了。**
>
> **我们不急于开放这个领域，是因为我们对它怀有敬畏。**
>
> **当我们最终开放时，它不会是一个"能用就行"的工具集合，而会是一个真正能帮助你**
> **"像巴赫一样思考对位法"、"像汉斯·季默一样构建史诗"、**
> **"像布莱恩·伊诺一样拥抱偶然性"的品味训练系统。**
>
> **请给我们一点时间。好的事情值得等待。🎵**

---

**相关链接：**
- 总控入口：`../SKILL.md` (AIGC Creative Skills v3)
- 其他已开放的领域：
  - 🎨 视觉艺术：`../visual/SKILL.md`
  - ✍️ 写作文学：`../writing/SKILL.md`
  - 🎬 影视视频：`../film-video/SKILL.md`
  - 💡 设计：`../design/SKILL.md`

**最后更新：2025年（v3.0.0 初始版本，占位状态）**

