中文视频分镜资产 Prompt 工作流
这个 skill 的目标不是普通出图,也不是单纯写视频 prompt,而是把用户的创意拆成一套可复用的视频生成资产:
固定链路:
用户文字 / 图片 + 文字 / 多参考图 + 文字
→ 导演 brief
→ 角色 / 场景 / 道具参考资产提示词
→ 15 宫格导演信息分镜板提示词
→ 视频生成提示词
核心不是只生成一张分镜图,而是先稳定"谁长什么样",再稳定"发生什么、怎么拍、什么节奏",最后让视频模型执行。15 宫格导演分镜板是必经中间资产;角色设定板 / 场景设定板 / 道具设定板按用户素材决定是否生成。
核心原则
- 中文优先:默认输出中文提示词。最终可复制提示词只保留真正有用的格式标记,如
P01-P15、16:9、5x3、Storyboard Ref。 - 先资产,后分镜,再视频:不要直接跳到视频 prompt;先判断是否需要生成角色/场景/道具参考资产,再生成 15 宫格导演分镜板,最后生成视频 prompt。
- 资产按需生成:不是每个主体都必须先生成独立设定板。身份最重要、会反复近景出现、需要长期复用的主体才优先独立成资产;没有参考图的次要主体、临时对手、普通道具,可以由 15 宫格故事板首次定义并控制。
- 有图就要上传图:用户提供了角色图、产品图、场景图或风格图时,生成 15 宫格分镜图也要把这些参考图一起上传给图像模型;prompt 负责说明每张图的控制范围,不能用文字描述替代参考图本身。
- 内部代号不要外露:可以在分析时临时用
C1、C2、ENV、PROP管理主体和资产,但最终给用户复制的 prompt 默认改成中文语义名,例如"主角灰猫"、"小棕鼠"、"厨房场景"、"奶酪道具"。除非用户明确要求技术代号,不要把C1/C2/ENV/PROP写进可复制提示词代码块。 - 操作说明和提示词分离,提示词内用干净引用名:上传哪些图、按什么顺序、每个参考图对应哪张文件,都放在提示词外的"上传顺序"里;可复制提示词内部统一用
参考图1、参考图2、参考图3这类干净引用名,不写"分镜阶段上传的第 N 张图片"、"视频阶段上传"、"如有"、"可选"这类操作话。 - 可复制提示词必须干净:最终代码块写成可直接复制的具体版本,只保留本次实际使用的参考图;不得保留
[占位符]、变量、如有、可选、如果没有参考图、"如果上传了参考图2..."、本地文件路径或任何操作说明——这些只能出现在代码块外的上传顺序 / 使用建议里。代码块内只写生成模型需要执行的内容。 - 导演信息板和视频参考板分清:默认先生成"导演信息版 15 宫格分镜板",包含项目卡、连续性头、15 格灰度/低色分镜和底部导演条,用来锁动作、镜头、节奏、状态。若视频模型把面板文字/灰度画风学进成片,再补一张"干净视频参考版 15 宫格关键帧板",去掉文字和粗边框。
- 图像 prompt 定时间轴:15 宫格图片不是普通海报,而是视频时间压缩图。
- 视频 prompt 执行分镜:视频模型必须按 P01 到 P15 顺序执行,不要重新发明剧情。
- 有对白先做时长预算:不要把长对白直接塞进一个 15 秒视频 prompt。先估算台词能否自然说完;超出时长就自动给出"精简单段版"、"多段拆分版"或"后期配音版",避免视频加速、嘴型乱跳、动作被压缩。
- 避免宫格入片:视频 prompt 必须声明:不要生成漫画分屏、宫格线、编号、标题、字幕、水印;15 宫格只是镜头参考,最终输出是一段连续电影画面。
- 参考图要分工:多张参考图不能混用,要明确哪张控人物、哪张控场景、哪张控道具/产品/风格。
- 锁连续性:角色身份、产品形态、空间方向、动作因果、特效来源必须写清楚。
- 知名 IP 转译:用户提到具体动画、电影、游戏或艺术家时,提取可泛化的视听方法,如"无对白追逐喜剧、夸张物理笑料、弹性肢体、管弦乐撞击点、厨房道具连锁反应",不要直接复制原作角色、商标、专有名字、标志性造型或独有设定。
资产类型
A. 角色 / 场景 / 道具参考资产
这一步用于稳定身份和美术,不负责视频动作。
如果用户只有文字需求:
- 先为主角、主产品、核心原创角色等身份关键主体生成角色设定板 / 产品设定板 prompt;场景设定板按复杂度决定。
- 每个角色单独一张设定板。不要把主角、对手、配角、宠物、怪物混在同一张角色设定板里,除非用户明确要求做"群像关系板"。
- 角色设定板应包含正面、侧面、背面、表情组、姿势组、剪影、服装/毛发/材质细节。
如果用户提供了角色参考图:
- 用图生图生成该角色自己的角色设定板,保留参考图里的脸、体型、毛发/服装、核心表情和气质。
- 不要只拿原图直接进分镜;先把它扩成角色板,后续分镜和视频更稳。
如果用户提供了场景 / 产品 / 道具参考图:
- 可生成场景设定板、产品多角度板或道具细节板。
- 简单需求可以不单独生成场景板,但要在分镜板里明确场景参考优先级。
参考资产的生成逻辑:
- 有参考图:输出图生图设定板提示词,要求用户上传对应参考图。
- 没有参考图但主体身份很重要:输出文生图设定板提示词,先创建该主体的参考资产。
- 没有参考图且主体只是对手、临时角色、普通道具或一次性机制:不强制生成独立设定板,由 15 宫格故事板首次定义它的外形、位置、动作和状态。
- 多个角色互动:主角通常独立生成;对手或第二主体只有在反复近景出现、要长期复用、外形复杂或用户明确要求时才单独生成。需要确认比例和关系时,可额外生成一张"关系/比例测试图",不要用它替代独立设定板。
B. 导演信息版 15 宫格分镜板
这是截图里那种资产:上方可有一张彩色 scene key / hero keyframe,中间或下方是 15 格灰度/低色分镜,底部是导演条。
它的作用:
- 让图像模型把一整段视频压成可读的 15 个动作阶段。
- 让视频模型读到 panel order、camera path、action path、rhythm、escalation、state。
- 给人类检查动作链、空间连续性和镜头节奏。
底部导演条不是装饰,它应包含:
BEAT LINE:每格一句动作/情绪 beat。CAMERA PATH:景别、镜头运动、角度、焦段。ACTION PATH:主体从哪里到哪里、做了什么。RHYTHM TRACK:保持 / 揭示 / 推进 / 爆发 / 撞击 / 停顿 / 终击。ESCALATION MAP:L1-L5 强度变化。STATE TRACK:角色、道具、场景、损伤、特效状态。STYLE TRACK:每格视觉效果和材质提示。
C. 干净视频参考版 15 宫格关键帧板
这是备选,不是默认第一产物。
当视频模型出现以下问题时,再生成:
- 把灰度草图、纸张、面板文字、导演条拍进视频。
- 画风被导演草图污染。
- 宫格线、编号、标题条进入成片。
干净版要求:
- 每格接近最终视频画风。
- 去掉底部导演条、标题条、编号、文字、粗边框。
- 仍保持 5x3 顺序和每格动作阶段。
- 视频 prompt 继续用文字 beats 补足导演信息。
视频模型现实约束
视频模型常见三个问题:
- 遵从分镜弱:模型可能只把 15 宫格当一张氛围图,不严格按每格动作执行。
- 误学分镜画风:模型可能把灰度草图、面板线、标题、编号、纸张质感、粗线条等当作最终视频画风。
- 对白超载:单段视频时长有限,长台词会导致模型强行加速、漏句、乱嘴型,动作和表情反应也会被压扁。
因此先用"导演信息版分镜板"锁结构;如果模型出现画风污染或宫格入片,再生成"干净视频参考版关键帧板"。
视频阶段按工具能力选择:
- 单图参考 / 只支持首帧的工具:不要把 15 宫格当普通首帧使用;如果只能上传一张图,优先上传"干净视频参考版 15 宫格关键帧板",并在 prompt 里强制说明它是镜头脚本,不是首帧画面。若工具仍把宫格拍进视频,改为上传 P01 单帧,同时把 P01-P15 beats 写进文本。
- 多图参考工具:第 1 张上传导演信息版或干净版 15 宫格控制动作和镜头;第 2 张起上传角色/产品/场景参考资产控制身份和画风。
- 支持参考权重/用途选择的工具:把 15 宫格设为结构/动作/pose/reference,把角色图或风格图设为外观/风格/reference。
输入识别
先判断用户给了哪种素材:
| 输入类型 | 处理方式 |
|---|---|
| 纯文字需求 | 先按重要度生成必要参考资产 prompt;没有参考且不需要独立身份的主体由故事板定义 |
| 单图 + 文字 | 先把图片扩成对应主体的独立设定板 prompt;其他无图主体默认由故事板控制,除非它也需要强一致 |
| 多图 + 文字 | 给每张图分配控制范围,并为每个关键主体分别生成/使用独立资产 |
| 已有角色图/场景图 | 15 宫格控制动作和镜头,角色/场景由参考图控制 |
| 已有角色设定板 | 跳过角色资产生成,直接生成导演分镜板 |
| 已有 15 宫格图 | 不再重写分镜图提示词,直接生成视频执行提示词 |
如果缺失信息会明显改变结果,最多问 3 个问题。用户说"直接做"时,直接做,并在输出中简短列出假设。
默认规格
- 分镜图比例:
16:9 - 分镜图布局:
5 列 x 3 行,共 15 格 - 分镜顺序:从左到右、从上到下,
P01到P15 - 输出语言:中文
- 默认视频用途:图生视频
- 默认视频风格:电影感连续镜头
- 默认声音:无配乐,仅环境声、动作声、材质声、呼吸、停顿和冲击声;用户要求音乐时再写音乐
对白与时长预算
有台词、采访、口播、旁白、歌词或字幕内容时,先做时长预算,再写视频 prompt。
- 用户未指定时长时,默认按单段
15s判断。 - 中文自然口播粗略按每秒 3-4 个汉字估算;喜剧采访需要停顿和反应,15 秒建议只放 35-55 个汉字,最多约 70 个汉字。超过这个范围,不要硬塞。
- 如果用户给的完整台词明显超过单段时长,先说明"完整台词不适合一次性塞进 15 秒",再选择方案:
- 精简单段版:只保留 2-4 句最强笑点或核心信息,视频 prompt 写短句、停顿和反应。
- 多段拆分版:把台词拆成多个 8-15 秒 clip,但不要写成多个风格各异的独立 prompt。先写一个"全片总控母版",锁定参考图、角色身份、导演分镜板、视觉风格、空间连续性和禁止项;再给每段写"分段执行块",只替换本段时长、对应 P 格、起止状态、台词、反应和衔接要求。
- 后期配音版:视频 prompt 只生成表演、反应和节奏,不要求模型完整说完;完整台词放在配音/字幕脚本里,交给剪辑后期。
- 对话型视频优先写"谁在第几秒说哪一句、停顿多久、镜头切到谁的反应",不要让一个镜头承担长段朗读。
- 如果只需要替换台词而不改画面,复用已有角色资产和 15 宫格,只重写视频 prompt 的"时长策略、台词分配、镜头与动作 beats"。
多段完整版的写法:
- 全片总控母版:每段都复用。包含上传参考、参考图优先级、最终画风、15 宫格只作镜头脚本、不要分屏/字幕/水印、角色/场景/道具连续性、全片情绪弧。
- 分段执行块:每段替换。包含 clip 编号、目标时长、对应 P 格、上一段末帧状态、本段首帧状态、本段尾帧状态、本段台词、停顿与反应、下一段衔接。
- 衔接锁:从第 2 段开始,明确"本段第一帧承接上一段最后一帧",保持人物站位、话筒方向、表情余韵、灯光和镜头轴线;如果工具支持多图参考,可在外部上传顺序里让用户额外上传上一段末帧作为连续性参考。
- 不要重写资产:多段拆分只改视频执行层。角色设定板、场景设定板、15 宫格导演分镜板继续作为同一套资产复用。
两种分镜图模式
根据用户素材选择模式,并在输出里说明。
多参考图模式
适合用户同时有角色图、场景图、道具图、产品图等。
- 15 宫格默认生成导演信息版分镜板,保留项目卡、连续性头、15 格分镜和底部导演条。
- 角色脸、服装、产品形态由参考图控制。
- 15 宫格主要控制动作、镜头、节奏、空间连续性。
单图视频模式
适合用户只想把一张 15 宫格图交给视频模型,或者不确定视频模型是否支持多图参考。
- 默认使用这个模式。
- 如果目标工具能理解 storyboard reference,默认先生成导演信息版分镜板。
- 如果目标工具容易把参考图当成首帧或风格图,改用干净视频参考版关键帧板。
- 每格都要保持同一角色、同一场景逻辑、同一色彩氛围和可读动作。
- 这张图同时承担角色一致性、风格一致性、空间参考和动作时间轴。
- 不要在格子里写大量文字、编号或箭头;这些会污染视频画面。
工作流
1. 提炼导演 Brief
把用户需求压成这 8 项:
- 主体:主角、对手、产品、道具、群体角色是谁。内部可以临时标记成代号方便推理,但输出给用户时改回中文语义名。
- 参考图分工:每张图控制什么;如果没有图,用文字设定替代。
- 场景:地点、时间、天气、光线、空间锚点。
- 起点:视频第一秒发生什么。
- 终点:视频最后一秒形成什么画面。
- 动作链:从起点到终点的 8-12 个可视动作。
- 情绪弧:用姿态、速度、眼线、距离、光线、空间压迫表达,不写抽象心理。
- 不可丢失元素:人物身份、服装、产品形态、道具、品牌元素、场景锚点、动作方向。
如果用户引用知名 IP 或具体作品风格,先把它转译成原创可执行风格 brief。例如"猫和老鼠动画片"转成"经典美式无对白猫鼠追逐喜剧、厨房道具连锁反应、夸张弹性肢体、瞬间定格表情、节拍型管弦乐和拟音",并明确不使用原作角色名、商标、片名视觉元素或一比一角色设计。
2. 建立参考优先级
参考图分工要写得像导演给美术和摄影的控制表:
- 生成 15 宫格分镜图时,凡是用户提供过的参考图,都应作为图像模型输入一起上传;如果目标工具不支持参考图,再退化为文字描述。
- 如果用户在对话里已经上传/附带了图片,先在外部上传顺序里按实际文件说明;可复制 prompt 内部改称
参考图1、参考图2、参考图3。 - 如果用户只给了一张猫图,外部上传顺序写"参考图1:原始猫图,用作主角灰猫参考图";可复制 prompt 里写"参考图1控制主角灰猫的脸型、体型、毛发、核心表情和气质"。
- 第一张参考图通常控制主角、主产品或核心主体的脸、体型、发型、服装、气质、轮廓。
- 第二张参考图通常控制场景、空间、光线、地面材质、背景锚点。
- 第三张参考图通常控制对手、第二角色、道具、产品、载具、怪物、机械结构或风格。
- 15 宫格分镜图控制镜头顺序、动作阶段、空间连续性、节奏和状态变化。
- 没有参考图且没有独立设定板的主体,必须在 15 宫格导演分镜板中被清楚定义;后续视频阶段由 15 宫格分镜板控制它的外形、动作和状态。
如果用户只给一张图,说明这张图控制主体和基础风格,15 宫格要补足动作时间轴。
3. 写参考资产提示词
先判断是否需要生成参考资产:
- 用户只有文字,没有稳定角色/场景图:优先为主角、主产品、核心原创角色生成设定板;对手、道具、场景按重要度决定是否单独生成。
- 用户给了单张角色图:需要为该角色生成图生图角色设定板,把单一表情/角度扩成多角度、多表情、多姿势参考。
- 用户已经给了完整角色设定板:可跳过这一步。
- 用户只想快速出视频:可以把这一步标为"可选但推荐",但仍说明跳过会降低角色一致性。
每个角色单独使用一个提示词。不要把两个不同角色放在同一张角色设定板里。
单角色设定板提示词结构:
生成一张 16:9 的角色设定板 / character reference sheet。
【上传参考】
参考图1控制该角色的脸型、体型、毛发/发型、服装/毛色、核心表情和气质。
【角色卡】
角色名:[最终输出时填成具体中文角色名,例如主角灰猫 / 小棕鼠 / 玻璃水杯助手]
角色类型:[猫 / 人物 / 产品拟人 / 机械角色等]
核心气质:[3-5 个可视化气质词]
视觉签名:[最能识别这个角色的 3-5 个视觉特征]
【设定板内容】
主视觉全身站姿 1 张,正面 / 侧面 / 背面三视图,3-5 个表情头像,3-4 个动作姿势,小剪影组,关键细节放大图。
所有小图必须保持同一角色身份、比例、毛发/服装/产品结构和色彩风格一致。
【风格】
[写目标最终视频风格;例如复古美式 2D 动画、电影感写实、赛博朋克动画、产品广告高级感等]
【禁止】
不要出现已有 IP 角色、商标、logo、水印、字幕;不要改变参考图主体身份;不要生成其他角色;不要把两个不同角色放进同一张设定板。
场景 / 产品 / 道具设定板按同样原则写:多角度、细节、材质、状态变化、尺度关系和最终视频风格。
4. 生成 15 格动作结构
默认使用下面的节奏,不要让 15 格成为 15 张无关美图:
| 格 | 功能 |
|---|---|
| P01 | 起始状态:主体第一次进入故事状态 |
| P02 | Master shot:完整交代空间地理、方向、距离、入口出口 |
| P03 | 关键细节:道具、产品、威胁、手部、屏幕、表情或触发点 |
| P04 | 第一轮移动:主体开始改变位置或姿态 |
| P05 | 第一次接触:冲突、互动、使用、转身、触碰、启动 |
| P06 | 反应特写:眼线、手、脸、产品反馈、对手反应 |
| P07 | 推进:动作进入稳定节奏 |
| P08 | 全局确认:俯视、侧广角或全景,确认空间没有乱 |
| P09 | 压力升级:速度、距离、光线、对手、环境或产品机制增强 |
| P10 | 可见影响:碰撞、结果、反馈、变形、亮起、破碎、靠近 |
| P11 | 细节插入:材质、倒影、手部、水面、包装、按钮、碎片 |
| P12 | 情绪停顿:给观众读状态,形成下一步动作前的呼吸 |
| P13 | 连续性承压格:最复杂动作必须从清楚方向发生,避免四面八方混乱 |
| P14 | 最终动作:突破、抵达、完成、揭示、拥抱、切换、落点 |
| P15 | 结果画面:最终状态、结果证据、余韵或收束构图 |
产品片也使用这个结构,只是把"冲突"换成"功能 reveal / 使用过程 / 材质证据 / 结果证明"。
5. 写 15 宫格导演分镜板提示词
提示词默认中文。结构必须完整,但语言要能被中文用户直接复制。默认生成"导演信息版 15 宫格分镜板":上方可放一张彩色 scene key / hero keyframe,中部为 15 格分镜,底部为导演条信息层。
使用这个模板:
生成一张 16:9 的导演信息版 15 宫格视频分镜板。画面上方可以放一张彩色 scene key / hero keyframe,用于呈现最终气氛;中部或下方为 5 列 x 3 行的 15 格分镜,从左到右、从上到下依次为 P01-P15;最底部放导演条信息层。每一格代表连续视频中的一个镜头阶段,不是独立海报。整体画面要清楚表达角色位置、动作方向、镜头变化、情绪推进和最终结果。
【项目卡】
标题:[短标题]
类型:[场景 / 类型 / 情绪或动作弧]
核心优先级:[列出 5-8 个最不能丢的连续性目标]
一句话 brief:[从 P01 到 P15 发生什么]
【参考图优先级】
[用干净引用名说明参考图分工,例如:参考图1控制主角灰猫的身份、比例、表情和毛发;参考图2控制厨房场景的空间、光线和环境锚点;参考图3控制奶酪道具或第二角色的结构。没有参考图的主体直接写具体中文定义,并说明由本分镜板控制。最终输出时不要在这里写上传顺序、文件路径或内部代号。]
角色设定板 / 场景设定板 / 道具设定板控制身份、外观、材质和最终画风。15 宫格导演分镜板控制动作阶段、镜头顺序、空间连续性、节奏和状态变化。没有参考资产的主体由本 15 宫格导演分镜板首次定义和控制。
【场景包】
前提:[谁在什么环境里完成什么变化]
地点:[固定空间锚点、前景/中景/背景、行动线]
起点 -> 终点:[第一格画面 -> 最后一格画面]
动作链:[用箭头串联 8-12 个可视动作]
道具 / 产品 / 特效状态:[道具、产品、光效、烟、水、碎片、屏幕、文字等如何出现和变化]
观众必须读懂:[一眼要看懂的主旨]
【主体设定与净化】
主角 / 主产品 / 核心主体:[最终输出时改成具体中文名,只写视觉可见的人物/产品/主体特征和动作功能]
对手 / 第二角色 / 核心道具 / 场景对象:[根据本次实际主体填写具体中文名;没有则删除本行]
去除不可见心理、过多背景故事、互相矛盾的特征和无法画进画面的细节。
【身份一致性】
[明确哪些脸、发型、服装、体型、产品形态、道具、品牌元素不能变化。禁止新增人物、复制主体、换装、变脸、年龄漂移、产品变形,除非用户明确要求。]
【分镜纯净规则】
15 格分镜可以是灰度/低色导演草图风,用来强调动作和构图,不追求最终色彩细节。格子内部不要放对白字幕、水印、logo、UI 覆盖、重复残影或多重身体。P01-P15 编号、镜头标签和 beat 名称可以放在每格外部顶部小条中,便于模型和人类读取顺序;不要让文字压住主体动作。
【P02 Master Shot 规则】
P02 必须交代完整可行动空间:[主体位置]、[目标/对手/产品位置]、[关键场景锚点]、[前景/背景]、[运动方向] 和 [距离关系]。
【空间连续性锁】
[说明哪些格共享同一空间布局;主体从哪里移动到哪里;镜头方向如何保持;场景锚点在哪里;允许变化的只有镜头距离、角度、姿态、光效密度、道具状态、环境运动和结果状态。]
【情绪与节奏弧】
[用眼线、手势、步伐、镜头距离、光线变化、速度、停顿、环境反应来表达情绪推进]
【视觉风格锁】
[写最终视频画风、色彩、光线、镜头质感;同时说明 15 格分镜层可以用灰度/低色导演草图表达动作,最终视频画风由角色/场景/风格参考资产控制。]
【15 格面板说明】
P01 / [镜头] / [beat]:[画面内容]
P02 / [镜头] / [beat]:[画面内容]
P03 / [镜头] / [beat]:[画面内容]
P04 / [镜头] / [beat]:[画面内容]
P05 / [镜头] / [beat]:[画面内容]
P06 / [镜头] / [beat]:[画面内容]
P07 / [镜头] / [beat]:[画面内容]
P08 / [镜头] / [beat]:[画面内容]
P09 / [镜头] / [beat]:[画面内容]
P10 / [镜头] / [beat]:[画面内容]
P11 / [镜头] / [beat]:[画面内容]
P12 / [镜头] / [beat]:[画面内容]
P13 / [镜头] / [beat]:[画面内容,必须解决最复杂动作的方向连续性]
P14 / [镜头] / [beat]:[画面内容]
P15 / [镜头] / [beat]:[最终结果画面]
【导演条】
底部 animatic track board 与 15 格列对齐。包含这些横向轨道:BEAT LINE、CAMERA PATH、ACTION PATH、RHYTHM TRACK、ESCALATION MAP、STATE TRACK、STYLE TRACK。使用短标签、细线、小节奏块和强度条,不写秒数。
BEAT LINE:[每格 1-3 个词概括 beat]
CAMERA PATH:[P01 到 P15 的景别、焦段、角度和运动变化]
ACTION PATH:[P01 到 P15 的主体动作变化和空间移动]
RHYTHM TRACK:[每格用 保持 / 揭示 / 推进 / 爆发 / 撞击 / 停顿 / 恢复 / 终击 等描述]
ESCALATION MAP:[每格用 L1 平静 / L2 紧张 / L3 上升 / L4 高压 / L5 峰值 + 上升/峰值/释放 描述]
STATE TRACK:[每格主体、道具、产品、场景或特效状态]
STYLE TRACK:[每格视觉效果、材质、光线或动作线提示]
【最终要求】
这是一张可供视频模型理解的 15 宫格连续分镜图。每格都服务于同一段视频的时间顺序,角色、场景、动作方向和最终结果必须连续一致。
6. 写视频生成提示词
视频提示词必须中文,并把 15 宫格从"图片内容"重新解释成"镜头参考"。
先在提示词外给用户写清视频阶段上传顺序:
- 如果视频工具只支持单图参考:上传第 1 张图片 = 生成好的 15 宫格分镜图。
- 如果视频工具支持多图参考:上传第 1 张图片 = 生成好的 15 宫格分镜图;第 2 张起按需要上传原角色图、场景图、产品/道具图。
- 视频 prompt 内部必须对应这个顺序,但只使用
参考图1、参考图2这类干净引用名,不写"视频阶段上传的第 1 张图片"。
使用这个模板。最终输出时按实际上传参考图保留对应行,不要留下待填项或内部代号:
请使用这张 15 宫格分镜图作为视频的连续镜头参考。每一格代表同一段视频中的一个连续镜头阶段,请按照 P01 到 P15 的顺序生成一段连贯的电影画面。
重要:不要生成漫画分屏,不要出现宫格线、面板编号、标题条、字幕、对白文字、水印、logo 或技术标注。15 宫格只作为镜头设计和动作节奏参考,最终输出必须是一段完整连续的视频画面。
时长策略:
[写目标时长、台词是否压缩、是否拆成多段。若目标为 15 秒,只保留能自然说完的短句,并给出停顿和反应镜头;不要要求角色在 15 秒内说完整长稿。]
参考使用:
- 参考图1为 15 宫格分镜图,控制镜头顺序、动作阶段、空间连续性和节奏。
- 参考图2为 [具体角色/产品参考图,最终输出时填成具体资产名],控制 [具体主体] 的脸、发型、体型、服装和气质。
- 参考图3为 [具体场景/道具参考图,最终输出时填成具体资产名],控制环境、光线、空间锚点、外形、材质、结构和状态变化。
视觉风格优先级:
- 最终视频的画风、色彩、光线和质感以 [用户指定最终风格 / 角色参考图 / 场景参考图 / 产品参考图] 为准。
- 15 宫格分镜图只控制镜头顺序、动作阶段、构图关系和节奏,不要模仿分镜图中的网格、边框、编号、纸张、线稿或排版风格。
- 如果 15 宫格图是关键帧板,则保留其中的最终画面风格;如果 15 宫格图是草图或低保真分镜,只读取动作与构图,不复制草图画风。
视频情绪弧:
[从起点情绪到终点情绪,用可见动作、镜头距离、速度、光线、环境反应表达]
镜头与动作 beats:
1. [P01 的动作和镜头,用视频语言写]
2. [P02]
3. [P03]
4. [P04]
5. [P05]
6. [P06]
7. [P07]
8. [P08]
9. [P09]
10. [P10]
11. [P11]
12. [P12]
13. [P13,强调复杂动作方向清楚]
14. [P14]
15. [P15,收束为最终画面]
声音与环境:
[环境声、脚步、衣料、机械、风、水、呼吸、材质摩擦、冲击、停顿;无音乐或按用户要求写音乐]
连续性规则:
- 保持主角、对手、产品、道具的身份、形态、服装、材质和比例一致。
- 保持场景锚点、运动方向、距离关系和光线逻辑一致。
- 不新增人物,不复制主体,不换装,不变脸,不改变产品结构,不发明替代结局。
- 不把 15 宫格画面本身拍进视频;只把它当作连续镜头脚本执行。
- 不模仿 15 宫格图片的面板边框、编号、纸张质感、草图线条或排版样式。
默认输出格式
最终回复默认用下面结构。不要只给模板,要根据用户需求填完整。
## 需求解析
- 输入类型:[纯文字 / 单图+文字 / 多图+文字 / 已有15宫格]
- 参考资产状态:[需要生成角色设定板 / 已有角色设定板 / 需要生成场景设定板 / 可跳过]
- 无参考主体处理:[由故事板控制 / 需要单独生成设定板 / 仅文字锁定]
- 分镜板模式:[导演信息版15宫格 / 干净视频参考版15宫格 / 两者都要]
- 视频模型使用模式:[单图参考 / 多图参考 / 只支持首帧 / 不确定]
- 时长与对白策略:[无对白 / 15秒精简版 / 多段拆分版 / 后期配音版]
- 主体与场景:[简要说明]
- 参考图分工:[有则写实际分工;没有则写无]
- 动作链:[一句话箭头链]
- 关键假设:[最多 5 条;信息足够时省略]
## 参考资产阶段上传顺序
- [列出生成角色/场景/道具设定板时需要上传到图像模型的图片;没有则写"无,直接使用文字生成"]
## 参考资产提示词
每个需要生成的资产单独给一个代码块,标题使用具体中文语义名,不使用内部代号。不需要生成的资产用普通文字说明原因,不要放进可复制 prompt 代码块。
```text
【主角灰猫角色设定板提示词】
[完整可复制的中文图片提示词]
```
```text
【厨房场景设定板提示词】
[完整可复制的中文图片提示词]
```
## 分镜阶段上传顺序
- [列出生成 15 宫格导演分镜板时需要上传的图片,例如"第1张:角色设定板;第2张:场景参考图;第3张:道具参考图"]
## 15 宫格导演分镜板提示词
```text
[完整可复制的中文图片提示词]
```
## 视频阶段上传顺序
- [单图视频模式:第 1 张上传生成好的 15 宫格分镜图]
- [多图视频模式:第 1 张上传生成好的 15 宫格分镜图;第 2 张起上传角色设定板、场景设定板、产品/道具设定板或原始参考图]
## 时长与对白策略
- [说明目标视频时长、台词是否超过承载量、最终采用精简单段 / 多段拆分 / 后期配音中的哪一种]
## 视频生成提示词
```text
[完整可复制的中文视频提示词]
```
## 使用建议
- 先按「参考资产阶段上传顺序」生成角色/场景/道具设定板。
- 再按「分镜阶段上传顺序」上传参考资产,使用「15 宫格导演分镜板提示词」生成分镜板。
- 再把这张 15 宫格图作为视频参考图,配合「视频生成提示词」做图生视频。
- 如果视频模型支持多图参考,把 15 宫格分镜板、角色设定板、场景设定板、产品/道具设定板一起上传;原始参考图可作为补充身份参考。如果只支持单图,优先上传 15 宫格图。
- 如果视频结果开始模仿分镜图画风或出现宫格边框,补生成一张"干净视频参考版 15 宫格关键帧板";如果仍不遵从,改用 P01 单帧作为首帧,把 P01-P15 动作写进视频文本。
工具适配
不要过度绑定工具,但可根据用户指定工具微调:
- GPT Image / GPT Image 2:结构化 prompt 可以长一些,适合生成清晰分镜板。
- 即梦 / Seedream:中文自然语言更稳,适合中文用户和中文语义场景。
- Midjourney:可保留中文 brief,但必要时给英文镜头关键词和风格词。
- Seedance / 即梦视频 / 可灵 / Runway / Pika:视频 prompt 重点写"按 15 宫格顺序执行"和"不要生成分屏/文字/宫格线"。
与其他 skill 的分工
- 用户只是做单张营销图、海报、配文和内容项目:优先用
content-studio-cy。 - 用户要从一张图扩展 3 个镜头:用
film-storyboard-expand-cy。 - 用户要复刻已有视频、拉片、拆 10 秒段落:用
video-replication-sop-cy。 - 用户要做完整视频生成 prompt,并需要 15 宫格作为视频中间资产:用本 skill。
自检清单
输出前逐项检查:
- 是否一定输出了 15 宫格分镜图提示词。
- 如果用户没有完整角色/主体参考资产,是否先输出了角色设定板或主体设定板提示词。
- 多个角色是否分开生成独立设定板,没有把主角、对手、配角混在同一张角色设定板里。
- 是否避免强制为所有无参考主体生成设定板;次要无参考主体可由 15 宫格故事板定义和控制。
- 是否输出了基于该 15 宫格图的视频生成提示词。
- 如果有对白/口播/旁白,是否先做了时长预算,没有把长台词硬塞进单段 15 秒视频。
- 长对白是否被处理成精简单段版、多段拆分版或后期配音版,并在视频 prompt 中写清台词分配与停顿。
- 是否中文为主,只有 P01-P15、比例、布局、工具需要的格式标记保留英文。
- 代码块里的可复制提示词是否没有裸露内部代号,而是改成了具体中文语义名。
- 如果用户给了参考图,是否明确说明生成 15 宫格图片时也要上传这些参考图。
- 代码块里的可复制提示词是否只使用
参考图1/参考图2/参考图3这类干净引用名,没有出现"已上传的第 N 张图片"、"分镜阶段上传"、"视频阶段上传"、文件路径或操作说明。 - 代码块里的可复制提示词是否没有留下
[占位符]、如有、可选、如果没有参考图等需要用户二次修改/删除的文字。 - 是否把参考资产阶段、分镜阶段、视频阶段的上传顺序放在提示词外说明。
- 视频 prompt 内部的引用关系是否与视频阶段上传顺序一致。
- 是否明确参考图分工。
- 是否说明 15 宫格控制动作、镜头、节奏和连续性。
- 是否在视频 prompt 中禁止生成漫画分屏、宫格线、编号、字幕、水印、logo。
- 是否区分导演信息版分镜板和干净视频参考版关键帧板;默认先产导演信息版,画风污染时再补干净版。
- 视频 prompt 是否明确最终画风来源,并禁止模仿分镜图的边框、编号、纸张、线稿或排版样式。
- 是否写清 P02 的 master shot 空间关系。
- 是否写清 P13 的复杂动作方向连续性。
- 是否锁住人物身份、产品形态、空间锚点、动作方向和最终结果。
- 是否没有假装已经生成图片或视频。