# Lyric Mv Storyboard

> 歌词驱动 MV 分镜生成器：输入歌词（支持 .lrc 时间轴或纯文本+BPM）、曲风、角色设定，自动分段切句、解析情绪、用三层表演体系（行动逻辑/表演节拍/面部时序）设计表演，生成时序分镜表与可直接执行的 MiniMax H3 原生提示词（T2VA/I2VA/Ref2VA），可接线 Z-Image 角色板 + RH Ref2VA/豆包 Seedance 出片并 ffmpeg 拼接。用户说"根据歌词设计 MV 分镜/给歌词生成视频提示词/做歌曲 MV 脚本/这首歌词怎么拍"时使用；歌词排版型 MV 走 music-video-subtitle-generator。

- Skill: `supermate-ai/lyric-mv-storyboard` (Agent Skill, multi-file: 9 files)
- Install (CLI): `npx skillmds@latest add supermate-ai/lyric-mv-storyboard`
- Raw SKILL.md: https://api.skillmd.com/api/skills/supermate-ai/lyric-mv-storyboard/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: SuperMate-Ai (https://skillmd.com/u/supermate-ai)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/supermate-ai/lyric-mv-storyboard

---


# 歌词驱动 MV 分镜生成器（lyric-mv-storyboard）

把一首歌的歌词变成**时序分镜表 + 可直接执行的 MiniMax H3 原生提示词**。
保留三层表演导戏体系（行动逻辑 → 表演节拍 → 面部时序），输出统一为 H3 原生格式
（字段名/顺序/标签与 `h3-prompt-writing` 完全一致），并系统化防变脸
（角色身份锚点 → Z-Image 角色板 → Ref2VA 锁身份）。

> 由 LyricToStoryboard skill JSON 优化而来：时间轴支持 LRC 精确解析；防变脸从一句
> "不随意修改"升级为可执行流程；提示词从"泛泛的 H3 语法"升级为可直接粘贴的 H3 原生正文。

## 何时用 / 何时不用

- **用**：用户提供歌词（纯文本或 `.lrc` 文件），要"按歌词做 MV 分镜、写 AI 视频提示词、
  出 MV 脚本、按歌词拍短片"。
- **不用**：无歌词的纯音乐 MV（用 `music-video-subtitle-generator` 的歌词生成分支）；
  歌词排版/字幕设计型 MV（`music-video-subtitle-generator`）；
  长剧集叙事（`video-production-studio`）。

## 输入

| 字段 | 说明 | 默认 |
|---|---|---|
| lyricText | 完整歌词文本；支持 `.lrc` 文件内容（含 `[mm:ss.xx]` 时间标签）或纯文本 | 必填 |
| musicStyle | 曲风：抒情流行 / 摇滚 / 国风 / 电子 / 民谣… | 抒情流行 |
| bpm | 歌曲 BPM，用于无 LRC 时估算单句时长 | 85 |
| globalMood | 整首歌情绪基调：失落遗憾 / 热烈释放 / 孤寂释然… | 按歌词推断 |
| characterRef | 角色固定参考描述（防变脸锚点） | 亚洲轻熟日系美人，极简黑色长裙，大红唇，皮肤白皙 |
| aspectRatio | 画幅：16:9 / 9:16 / 4:3 / 21:9 | 16:9 |
| outputMode | markdown（表格脚本） / raw（纯结构化数据） | markdown |
| lrcInput | 可选：`.lrc` 文件路径或原文；提供后取代 BPM 估算 | 无 |

## 工作流（六步）

### 步骤 1 · 时间轴锁定

- **有 LRC**：解析 `[mm:ss.xx]` 时间标签（支持一行多标签、重复行），生成逐句精确时间轴；
  相邻歌词行之间的空白（>2.5s）标记为**器乐间奏**段。规则见 `references/lrc-timeline.md`。
- **无 LRC**：按 BPM 估算——拍长 = 60/BPM 秒；每句时长 ≈ 字数 × 拍数系数
  （抒情 0.35-0.45 秒/字，说唱 0.25-0.35 秒/字），句间停顿 0.5-1 拍；段落间加 1-2 拍呼吸。
  切分点必须落在**语义停顿**上，不强行按毫秒切。

### 步骤 2 · 歌词分段切分

把歌词切分为：主歌 → 预副歌 → 副歌 → 桥段 → 尾声（→ 器乐间奏）。段与段之间的情绪落差
是分镜节奏的骨架；副歌通常是视觉与表演的高峰。

### 步骤 3 · 逐句切片解析（三层表演体系）

对每个时间切片提取四项：

1. **本句核心意象**：画面里能看到的物/景/动作（不是抽象情绪词）；
2. **本句内在情绪**：这句歌词的情绪温度与方向；
3. **行动逻辑**：角色目标（此刻想要什么）→ 当下阻碍（什么挡着）→ 行为策略（怎么应对）；
4. **表演节拍**（每句只取**一个**主导节拍，跟随歌词情绪流动，禁止全程同一表情）：
   `平静 / 掩饰 / 失衡 / 抑制 / 释放 / 恍惚 / 决绝`；
5. **面部动作时序**：表情如何**启动**（触发信号）→ 到达**情绪峰值**（微表情/呼吸/视线落点）→
   之后如何**逐步消退**（回到什么状态）。

写法规则与示例见 `references/performance-system.md`。

### 步骤 4 · 场景、镜头与转场设计

- 基于本句意象生成对应场景环境；同一意象跨句复用场景，副歌可做场景情绪升级（同景不同光/时段）；
- 运镜：推 / 拉 / 摇 / 环绕 / 固定机位 / 跟拍 / 缓慢横移；每镜一个主运镜，有叙事理由；
- 定义光影、主色调、画面氛围；整体色调跟随 globalMood 有一条渐变曲线；
- 转场可选：淡入淡出 / 硬切 / 虚焦转场 / 运动衔接转场；**禁止无逻辑突兀跳转**；
- 人物外貌严格遵守 characterRef（见防变脸），不随意修改。

### 步骤 5 · 输出分镜表

表格字段：`时间｜歌词原文｜场景｜运镜光影｜人物表演(行动逻辑+节拍+面部时序)｜转场｜AI视频提示词片段`。
器乐间奏行：歌词栏留空，写【器乐间奏】，侧重镜头流动与人物静默表演承接上一段情绪。

### 步骤 6 · 输出 H3 原生提示词 + 全局合并提示词

每个分镜的「AI视频提示词片段」= **整段 H3 原生提示词**，可直接粘贴执行。模式选择：

| 参考情况 | H3 模式 |
|---|---|
| 无参考图（纯文生） | T2VA（三核心字段） |
| 有角色板/首帧图（单张） | I2VA（首帧指令行 + 三核心字段） |
| 角色板+场景板多参考（MV 主力，锁身份） | Ref2VA（六段式） |

最后输出**全局合并提示词**：全局美术锚点（风格/主色调/画幅/质感）+ 逐镜 H3 正文按时间轴拼接
（>15s 走多镜头拼接协议，见下）。格式规范见 `references/h3-output-format.md`。

## 防变脸（可执行流程，不是一句"不随意修改"）

1. **身份锚点**：把 characterRef 扩写成可生成的最小识别锚点
   （脸型/发型/发色/五官特征/体型/服装款式颜色材质/标志物），写进全局提示词；
2. **可选角色板**：先用 Z-Image（`comfyui_generate`）出 1 张角色板（正面半身，白/灰背景，
   无场景），生产时作 `<Picture N>` 参考；
3. **三测试**（写完后自查）：剪影（涂黑认人）/ 溯源（删哪个特点角色就丢了）/
   三距（远读剪影色块、中读形状姿态、近读五官细节）；
4. **参考控制边界**：角色板只控制「身份/造型」，不得控制「构图/动作/背景」；
   场景板只控制「场景/光线/氛围」；写进 `reference_bindings`；
5. **生产通道**：有角色板 → RH H3 **Ref2VA**（参考图锁身份不作字面首帧）或 I2VA（竖屏）；
   无参考 → 豆包 Seedance 文生视频（真人脸参考不能上传，先反推文字锚定）。

## 多镜头拼接（MV 总时长 > 15s）

单段生成上限（约 10-15s）之外自动采用拼接协议：

1. **全局美术头**：每段携带同一美术锚点（风格/颗粒/LUT/光向），压低批次色差；
2. **拍点切**：切点落在节拍（1/4 或 1/8 拍）、鼓点、或歌词气口上，不在元音中间硬切；
3. **头尾帧衔接**：同场景延续段，用上一段尾帧作下一段首帧（I2VA/FL2VA 续拍）；
   硬切段保持同角色卡/服装/光语言；
4. **全局音轨**：所有片段绑定同一 Master Audio（原曲），剪辑对齐时间轴后硬切拼接，
   统一 LUT + 35mm 颗粒收尾（ffmpeg）。

## 强制约束

1. 禁止使用特殊符号；输出标点只使用中英文标准标点。
2. 表演节拍跟随歌词情绪流动，不要全程同一个表情。
3. 提示词正文遵循 H3 语法：含画幅、电影机参数（镜头语言写自然英文：类型+幅度+速度）、画质描述；
   对白/歌词写 `<d>[语言] 原文</d>` 逐字保留。
4. 器乐间奏行歌词栏留空写【器乐间奏】，侧重镜头流动，人物静默表演承接上一段情绪。
5. outputMode=markdown 输出分镜表；outputMode=raw 输出结构化原始数据，不闲聊。
6. 歌词是锁定输入：不增写、不翻译、不改写歌词；歌词不得用于未经授权的商业用途。

## 按需知识

- 时间轴规则（LRC 解析 / BPM 估算 / 切分点）：`references/lrc-timeline.md`
- 三层表演体系（节拍词表 / 面部时序 / 表演弧）：`references/performance-system.md`
- 场景镜头转场与多镜头拼接：`references/mv-shot-design.md`
- H3 输出格式与防变脸通道：`references/h3-output-format.md`
- 完整输出样例（真实歌词跑通）：`examples/real-lyric-run.md`

复杂 Ref2VA 写正文前，直接读 `h3-prompt-writing` 技能的 `references/ref-en.txt`；
基础模式读 `references/base-en.txt`。

## 前置检查（进入生产时）

1. ComfyUI 8188 在跑（Z-Image 出角色板/场景板）；
2. RH 脚本 `Local_LLM/RH_Workflow_Api/` 可用且 `--check` 通过（Ref2VA/I2V）；
3. 豆包通道需夸克调试模式 + doubao.com 登录态（Seedance 文生视频）；
4. 机器约束：ComfyUI 生成期间不跑 Ollama 视觉分析；质检只在队列空闲时进行。

