歌词驱动 MV 分镜生成器(lyric-mv-storyboard)
把一首歌的歌词变成时序分镜表 + 可直接执行的 MiniMax H3 原生提示词。
保留三层表演导戏体系(行动逻辑 → 表演节拍 → 面部时序),输出统一为 H3 原生格式
(字段名/顺序/标签与 h3-prompt-writing 完全一致),并系统化防变脸
(角色身份锚点 → Z-Image 角色板 → Ref2VA 锁身份)。
由 LyricToStoryboard skill JSON 优化而来:时间轴支持 LRC 精确解析;防变脸从一句 "不随意修改"升级为可执行流程;提示词从"泛泛的 H3 语法"升级为可直接粘贴的 H3 原生正文。
何时用 / 何时不用
- 用:用户提供歌词(纯文本或
.lrc文件),要"按歌词做 MV 分镜、写 AI 视频提示词、 出 MV 脚本、按歌词拍短片"。 - 不用:无歌词的纯音乐 MV(用
music-video-subtitle-generator的歌词生成分支); 歌词排版/字幕设计型 MV(music-video-subtitle-generator); 长剧集叙事(video-production-studio)。
输入
| 字段 | 说明 | 默认 |
|---|---|---|
| lyricText | 完整歌词文本;支持 .lrc 文件内容(含 [mm:ss.xx] 时间标签)或纯文本 |
必填 |
| musicStyle | 曲风:抒情流行 / 摇滚 / 国风 / 电子 / 民谣… | 抒情流行 |
| bpm | 歌曲 BPM,用于无 LRC 时估算单句时长 | 85 |
| globalMood | 整首歌情绪基调:失落遗憾 / 热烈释放 / 孤寂释然… | 按歌词推断 |
| characterRef | 角色固定参考描述(防变脸锚点) | 亚洲轻熟日系美人,极简黑色长裙,大红唇,皮肤白皙 |
| aspectRatio | 画幅:16:9 / 9:16 / 4:3 / 21:9 | 16:9 |
| outputMode | markdown(表格脚本) / raw(纯结构化数据) | markdown |
| lrcInput | 可选:.lrc 文件路径或原文;提供后取代 BPM 估算 |
无 |
工作流(六步)
步骤 1 · 时间轴锁定
- 有 LRC:解析
[mm:ss.xx]时间标签(支持一行多标签、重复行),生成逐句精确时间轴; 相邻歌词行之间的空白(>2.5s)标记为器乐间奏段。规则见references/lrc-timeline.md。 - 无 LRC:按 BPM 估算——拍长 = 60/BPM 秒;每句时长 ≈ 字数 × 拍数系数 (抒情 0.35-0.45 秒/字,说唱 0.25-0.35 秒/字),句间停顿 0.5-1 拍;段落间加 1-2 拍呼吸。 切分点必须落在语义停顿上,不强行按毫秒切。
步骤 2 · 歌词分段切分
把歌词切分为:主歌 → 预副歌 → 副歌 → 桥段 → 尾声(→ 器乐间奏)。段与段之间的情绪落差 是分镜节奏的骨架;副歌通常是视觉与表演的高峰。
步骤 3 · 逐句切片解析(三层表演体系)
对每个时间切片提取四项:
- 本句核心意象:画面里能看到的物/景/动作(不是抽象情绪词);
- 本句内在情绪:这句歌词的情绪温度与方向;
- 行动逻辑:角色目标(此刻想要什么)→ 当下阻碍(什么挡着)→ 行为策略(怎么应对);
- 表演节拍(每句只取一个主导节拍,跟随歌词情绪流动,禁止全程同一表情):
平静 / 掩饰 / 失衡 / 抑制 / 释放 / 恍惚 / 决绝; - 面部动作时序:表情如何启动(触发信号)→ 到达情绪峰值(微表情/呼吸/视线落点)→ 之后如何逐步消退(回到什么状态)。
写法规则与示例见 references/performance-system.md。
步骤 4 · 场景、镜头与转场设计
- 基于本句意象生成对应场景环境;同一意象跨句复用场景,副歌可做场景情绪升级(同景不同光/时段);
- 运镜:推 / 拉 / 摇 / 环绕 / 固定机位 / 跟拍 / 缓慢横移;每镜一个主运镜,有叙事理由;
- 定义光影、主色调、画面氛围;整体色调跟随 globalMood 有一条渐变曲线;
- 转场可选:淡入淡出 / 硬切 / 虚焦转场 / 运动衔接转场;禁止无逻辑突兀跳转;
- 人物外貌严格遵守 characterRef(见防变脸),不随意修改。
步骤 5 · 输出分镜表
表格字段:时间|歌词原文|场景|运镜光影|人物表演(行动逻辑+节拍+面部时序)|转场|AI视频提示词片段。
器乐间奏行:歌词栏留空,写【器乐间奏】,侧重镜头流动与人物静默表演承接上一段情绪。
步骤 6 · 输出 H3 原生提示词 + 全局合并提示词
每个分镜的「AI视频提示词片段」= 整段 H3 原生提示词,可直接粘贴执行。模式选择:
| 参考情况 | H3 模式 |
|---|---|
| 无参考图(纯文生) | T2VA(三核心字段) |
| 有角色板/首帧图(单张) | I2VA(首帧指令行 + 三核心字段) |
| 角色板+场景板多参考(MV 主力,锁身份) | Ref2VA(六段式) |
最后输出全局合并提示词:全局美术锚点(风格/主色调/画幅/质感)+ 逐镜 H3 正文按时间轴拼接
(>15s 走多镜头拼接协议,见下)。格式规范见 references/h3-output-format.md。
防变脸(可执行流程,不是一句"不随意修改")
- 身份锚点:把 characterRef 扩写成可生成的最小识别锚点 (脸型/发型/发色/五官特征/体型/服装款式颜色材质/标志物),写进全局提示词;
- 可选角色板:先用 Z-Image(
comfyui_generate)出 1 张角色板(正面半身,白/灰背景, 无场景),生产时作<Picture N>参考; - 三测试(写完后自查):剪影(涂黑认人)/ 溯源(删哪个特点角色就丢了)/ 三距(远读剪影色块、中读形状姿态、近读五官细节);
- 参考控制边界:角色板只控制「身份/造型」,不得控制「构图/动作/背景」;
场景板只控制「场景/光线/氛围」;写进
reference_bindings; - 生产通道:有角色板 → RH H3 Ref2VA(参考图锁身份不作字面首帧)或 I2VA(竖屏); 无参考 → 豆包 Seedance 文生视频(真人脸参考不能上传,先反推文字锚定)。
多镜头拼接(MV 总时长 > 15s)
单段生成上限(约 10-15s)之外自动采用拼接协议:
- 全局美术头:每段携带同一美术锚点(风格/颗粒/LUT/光向),压低批次色差;
- 拍点切:切点落在节拍(1/4 或 1/8 拍)、鼓点、或歌词气口上,不在元音中间硬切;
- 头尾帧衔接:同场景延续段,用上一段尾帧作下一段首帧(I2VA/FL2VA 续拍); 硬切段保持同角色卡/服装/光语言;
- 全局音轨:所有片段绑定同一 Master Audio(原曲),剪辑对齐时间轴后硬切拼接, 统一 LUT + 35mm 颗粒收尾(ffmpeg)。
强制约束
- 禁止使用特殊符号;输出标点只使用中英文标准标点。
- 表演节拍跟随歌词情绪流动,不要全程同一个表情。
- 提示词正文遵循 H3 语法:含画幅、电影机参数(镜头语言写自然英文:类型+幅度+速度)、画质描述;
对白/歌词写
<d>[语言] 原文</d>逐字保留。 - 器乐间奏行歌词栏留空写【器乐间奏】,侧重镜头流动,人物静默表演承接上一段情绪。
- outputMode=markdown 输出分镜表;outputMode=raw 输出结构化原始数据,不闲聊。
- 歌词是锁定输入:不增写、不翻译、不改写歌词;歌词不得用于未经授权的商业用途。
按需知识
- 时间轴规则(LRC 解析 / BPM 估算 / 切分点):
references/lrc-timeline.md - 三层表演体系(节拍词表 / 面部时序 / 表演弧):
references/performance-system.md - 场景镜头转场与多镜头拼接:
references/mv-shot-design.md - H3 输出格式与防变脸通道:
references/h3-output-format.md - 完整输出样例(真实歌词跑通):
examples/real-lyric-run.md
复杂 Ref2VA 写正文前,直接读 h3-prompt-writing 技能的 references/ref-en.txt;
基础模式读 references/base-en.txt。
前置检查(进入生产时)
- ComfyUI 8188 在跑(Z-Image 出角色板/场景板);
- RH 脚本
Local_LLM/RH_Workflow_Api/可用且--check通过(Ref2VA/I2V); - 豆包通道需夸克调试模式 + doubao.com 登录态(Seedance 文生视频);
- 机器约束:ComfyUI 生成期间不跑 Ollama 视觉分析;质检只在队列空闲时进行。