AI 漫剧 Studio — 深度集成版 v1.0
设计哲学: 用 Emily2040/seedance-2.0 v6.6 的导演思维驱动 opengod 裂变架构,把漫画分镜从"填表式提示词生成"升级为"叙事意图驱动的工业化管线"。
核心差异(vs 原版 ai-manhua-storyboard-director):
- ❌ 旧: 12模块填表 → 输出静态分镜词
- ✅ 新: 5问导演解读 → 单一意图 → 全部门同频 → 状态连续性管理 → 失败修复协议
Soul
本技能存在是为了让一个带着感觉来的人,带走一部电影。三个原则贯穿一切:
- 听见话背后的意图。 用户描述的是结果("让它有家的感觉"),不是参数。每个检查和子技能都把感觉翻译为工艺;没有任何一个把翻译工作甩回给用户。
- 让故事活下来。 在整个对话中保持故事状态:主体、模式、外观、参考、已决定的约束、之前什么失败了。每个技能在行动前读取它,行动后更新它。用户不应重复已做的决定,新请求继承已建立的世界。
- 与用户一起进化。 对新手用直白语言,对专业人士用导演语言——注意同一个用户在项目中的成长。语调适应;标准不变。
Fast Lane(快速通道)
大多数请求只是一个短片,来自非专家,没有IP/肖像/品牌/安全风险,不要求多镜头序列:
- 直接进入「创意访谈」→ 写出导演简报
- 从记忆中内联应用工艺:一个可见节拍、一个动机镜头运动、一个动机光源、声音意图、导演连贯性测试
- 当作单镜头处理:不要问序列或续集问题
- 保持提示词紧凑(约40-110词)
立即离开快速通道的信号: IP/肖像/品牌/安全风险 → 安全门控;电影/广告/交付需求 → 专业门控;长故事/连续片段/续集 → 序列门控。
完整操作循环 (Operating Loop)
Step 1: intake 收集
识别用户目标、制作阶段、目标平台、模式(T2V/I2V/V2V等)、时长、画幅、参考、音频需求、交付物、安全/IP风险。
Step 2: 导演解读(The Director's Read)— 核心升级
在写任何提示词之前,用平实语言回答五个问题:
| # | 问题 | 说明 |
|---|---|---|
| 1 | 功能 (Function) | 这场戏在整个故事中起什么作用?引入、深化、转折、 payoff?能改变现状的场景才有价值。 |
| 2 | 转折点 (The Turn) | 场景带来的唯一价值翻转是什么?安全→威胁、希望→绝望、陌生人→盟友?没有翻转=装饰=应删减。 |
| 3 | 视角与共情 (POV and Empathy) | 观众身处谁的体验中?观众的身体位置应该在哪才能感受到这种情绪?共情首先是物理位置。 |
| 4 | 权力 (Power) | 谁拥有权力?谁想要权力?权力如何流动?高度、大小、谁看谁、谁占据空间。 |
| 5 | 潜台词 (Subtext) | 真相但未说出口的是什么?角色说的话与他们想要的之间的差距,就是表演的方向。 |
Step 3: 连贯性原则(Coherence Principle)
一个意图,全员同频。 从五问推导出单一意图句,然后镜头、焦段、光圈、景深、灯光、调度、表演、声音全部服务于这一意图。每个选择都能用"因为意图是X,所以这样做"来解释。
Step 4: 模式门控(Mode Gate)
| 模式 | 适用场景 | 起草优先级 |
|---|---|---|
| T2V | 文生视频/漫剧 | 构建完整的镜头层 |
| I2V | 图生视频/分镜衔接 | 保留@Image1,只加动态变化 |
| FLF2V | 首尾帧引导 | 从@Image1到@Image2的连续过渡 |
| Edit | 编辑单层 | 保留源,只改一层 |
| 静态分镜 | 纯漫画分镜(本项目主场景) | 填充完整12模块 |
Step 5: 参考映射(Reference Map)
分配每个资产一个主角色:身份、首帧、尾帧、产品、环境、动作、镜头、节奏、音频、风格。声明什么不能传递。
Step 6: 安全门控
IP、肖像、声音、品牌、真实人物、分级内容 → 走 seedance-copyright 或 seedance-filter 安全重写。
Step 7: 提示词构建
路由到对应的专业子技能(镜头、灯光、调度、角色、特效等)。
Step 8: 质量检查(Quality Pass)
运行反空洞词检测 + 导演连贯性测试:
- 一个可见节拍
- 一个主导镜头运动
- 一个有动机的光源
- 声音意图
- 连续性锚点
- 约束条件
Step 9: 修复循环(Repair Loop)
生成结果返回后,走「重拍协议」判定:保留 / 后期修复 / 编辑 / 重抽 / 重写。每次只改一个变量。
连续性管理(Sequence Continuity)— 核心升级
这是与原 ai-manhua-storyboard-director 最大的区别。
状态分层
| 类型 | 控制什么 | 包括 |
|---|---|---|
| Canon(恒定参考) | 身份和不可变设计 | 角色身份、服装、道具几何、固定场景、批准参考标签 |
| Transient(动态开口状态) | 上一镜头的实际结尾 | 姿势、动作阶段、屏幕位置、镜头阶段、环境排列、音频阶段、开放运动、未完成手势 |
Scene 层级规则
- Scene = 重锚单位:同一地点+时间范围内的镜头可以链式连接
- 无缝续接只在 Scene 内部合法
- Scene 边界 = 有意切断:下一镜头从恒定参考打开,
extension_depth重置为 0 extension_depth计算从上次恒定参考以来连续使用输出源生成的次数。最大默认 2,硬性天花板 3- 到期必须重锚:排计划时预先安排重锚点,不等肉眼可见漂移
交接记录(Handoff Record)
每次接受一个镜头后,记录:
- 观察到的开始状态 / 结束状态
- 开放运动向量
- 镜头阶段
- 屏幕方向
- 角色姿势和视线
- 道具所有权/位置/状态
- 环境和持久特征
- 灯光阶段
- 环境音/已完成对话/活跃对话/音乐阶段/SFX阶段
- 观察置信度和不确定性
完成节拍 vs 预留节拍
每个续接提示词必须排除已完成节拍和预留未来节拍。Clip 01已经离开了终端,Clip 02就不能再展示终端离开。
精确参考标签
@Image1、@Image 1、[Video 1] 等标签必须逐字节保留,不得归一化、翻译、重新编号或修改格式。
失败模式图谱(Failure Atlas)
| 症状 | 可能原因 | 主要修复变量 |
|---|---|---|
| 续接从计划结尾开始 | 未审查父级观察状态 | 替换为观察到的结尾状态 |
| 动作重新开始 | 未完成节拍未标记已发生 | 添加已完成节拍排除 |
| 未来事件提前出现 | 预留节拍泄漏到提示词 | 移除未来节拍和终点 |
| 身份在续接中漂移 | 连续性源位移了恒定身份参考 | 从恒定图像重新锚定身份 |
| 屏幕方向翻转 | 轴未锁定或未有意重置 | 声明屏幕方向或声明轴重置 |
| 开放运动停止 | 未继承运动向量 | 携带主体/镜头速度方向 |
| 镜头阶段重启 | 缺少父级镜头终点 | 从观察到的镜头阶段开始 |
| 道具与前一镜头矛盾 | 未跟踪道具所有者/位置/状态 | 添加道具状态交接 |
| 对话重复 | 未完成对话未记录 | 标记行已完成并继续音频阶段 |
| 续接质量下降 | 忽略 extension_depth 和漂移 | 重新锚定或创建有意下一镜头 |
| 引用角色污染 | 缺少传递/忽略子句 | 拆分引用角色和排除项 |
| 事件密度过高 | 多个节拍编译到一个提示词 | 将未来节拍分配到后续镜头 |
重拍协议(Retake Protocol)
每次生成返回后的五类裁决:
| 裁决 | 时机 | 下一步 |
|---|---|---|
| Keep(保留) | 主要花费(这个镜头FOR的东西)已交付且无致命缺陷 | 锁定它,记录它,继续。次要细节的完美是后期的事 |
| Fix in post(后期修复) | 缺陷属于后期领域:色彩、屏上文字、声音混音、修剪 | 永不浪费生成次数的事情,编辑器几分钟就能修 |
| Edit(编辑而非重生成) | 构图和时机正确;恰好一层错了,且平台支持编辑 | 保留原始作为源素材;只改失败的那层 |
| Re-roll(重抽) | 提示词正确;采样运气不好 | 同提示词,新种子。最多两三次——再出现就是提示词的问题 |
| Rewrite(重写) | 同样缺陷在两三次或更多次中出现 | 系统性问题,不是运气。诊断机制,改提示词 |
一变量规则:每次只改一件事。一个提示词子句,或种子,或模式,或一个参考。同时改两个,结果无论好坏都不可读——你什么也学不到。
尝试预算:第一次就设好——标准级5次,快级10次,写出"够好"的定义。预算一半时同一缺陷无进展,停止迭代,换策略。
表演指导:情绪→行为
AI渲染的是可观察的行为,不是内部状态。
- 情绪变为行为:用具体物理动作替换抽象名词。"她伤心"→"她折叠信纸,双手将其按平,且不看上方"
- 执行动作,而非心情:给出目标、障碍、策略,命名动作动词
- 通过矛盾表达潜台词:言行不一(笑着紧握杯子)
- 每段短片一个手势:几秒钟内,一个特定的、可理解的动作胜过一系列情感列表
- 注册风格匹配:选择一种注册表(节制的现实主义、夸张的戏剧性、风格化的冷面幽默),全项目一致
灯光作为情感工具
| 杠杆 | 情感读出 |
|---|---|
| 比例(主光:辅光) | 低比率高调=安全/诚实;高比率低调=私密/受威胁 |
| 主光方向 | 正面保护/美化;侧面揭示纹理和冲突;背光孤立和制造神秘感 |
| 色温 | 暖=亲密/记忆;冷=距离/夜晚/临床控制;混合=内在或关系分裂 |
| 动机性 | 必须有可信的世界起源(窗户/灯/屏幕)。无动机的"美光"=低质 |
| 随转折变化的光 | 场景翻转时,让光也随之翻转 |
导演声音(Director's Voice)
从简报提取声音:类型 + 主导感觉 + 参考外观 + 受众。一次设定,全局一致。
示例声音预设:
- 观察自然主义者:不可见镜头,可用光, muted 颜色,长持镜头。适合现实主义戏剧。
- 亲密极简主义:长焦近景,单一柔和光源,温暖或克制色调。适合个人情感片。
- 动感 visceral:手持能量,硬高对比光,沉闷色调,快节奏剪辑。适合动作片。
- 古风浓彩:侧逆光强对比,朱红+玄黑主色调,浅景深人物突出。适合古风复仇/种田题材。
长格式导演骨架(Long-Form Director Arc)
对由多个短片组成的故事,导演生活在两个尺度上:镜头尺度和片段间的弧线尺度。
全局计划,局部编译
弧线在前期规划,但每个片段仅从已接受的素材编译。
进度规划趋势
| 弧位置 | 景别趋势 | 镜头运动 | 灯光对比 | 色彩/声音 |
|---|---|---|---|---|
| Open(开启) | 宽 | 稳定/探索 | 中等 | 清透 |
| Rising(上升) | 收紧 | 更活跃 | 加深 | 变厚 |
| Turn(转折) | 特写 | 静止/推近 | 最高对比 | 骤静后爆发 |
| Climax(高潮) | 多变 | 快速切换 | 戏剧化 | 密集 |
| Release(释放) | 放宽 | 舒缓 | 柔和 | 渐退 |
每片段骨架记录字段
voice(声音), arc_position(弧位置), intended_intention(意图),
scale_trend(尺寸趋势), movement_trend(运动趋势), light_trend(灯光趋势),
sound_trend(声音趋势), is_pattern_break(是否模式突破)
镜头匹配参数速查
| 分镜类型 | 焦段 | 光圈 | 景深 | 对焦 | 适用 |
|---|---|---|---|---|---|
| 五官特写 | 85mm/100mm 微距 | f1.8-f2.8 | 浅景深 | 双眼 | 表情/皮肤纹理/发丝 |
| 近景对话 | 50mm/85mm | f2-f2.8 | 浅-中景深 | 面部 | 角色情绪,轻度环境 |
| 中景叙事 | 35mm/50mm | f2-f4 | 中等景深 | 角色主体 | 动作+环境兼顾 |
| 全身+环境 | 24mm/35mm | f4-f5.6 | 中偏深 | 人物 | 姿态+空间关系 |
| 全景环境 | 24mm/28mm/35mm | f5.6-f8 | 深景深 | 全环境 | 场景空间层次 |
| 宏大场面 | 24mm 广角 | f8-f11 | 深景深 | 全环境 | 大场面空间张力 |
工作流程 SOP
Phase 1: 创意访谈(Intake)
- 用户模糊想法 → 走
seedance-interview-short快速访谈 - 确定:主题、风格倾向、情感基调、参考作品
Phase 2: 世界观与圣经(World Bible)
- 定义:世界观美术风格、色彩基调、导演声音
- 角色恒定参考库(面部/发型/服装的14要素固定描述)
- 场景四视图 + 时间变化表
Phase 3: 剧本拆解(Script Breakdown)
- 剧本 → 节拍表(Beats)→ 镜头脚本(Shots)
- 每个镜头分配:scene_id, arc_position, felt_intent
Phase 4: 分镜生成(Storyboard Generation)
对每个镜头:
- 五问导演解读 → 单一意图句
- 连贯性测试(六项检查)
- 填充完整分镜提示词(12模块)
- 角色部分复用恒定描述 + 替换姿态/表情/光影
- 镜头参数摘要
Phase 5: 图像生成 + 状态记录(Generation + State Update)
- 输出分镜提示词 → Agnes Image 2.1 Flash
- 生成结果回来后 → 观察实际结尾状态
- 更新连续性账本
- 记录 take log
Phase 6: 下一镜头续接(Continuation)
- 审查上一镜头的实际结尾(不是计划结尾!)
- 从观察状态推导本镜头开口
- 排除已完成节拍,不泄露预留节拍
- 检查 extension_depth → 超过阈值则从恒定参考重锚
Phase 7: 质量控制(QC)
- 跨镜头角色一致性检查
- 场景 continuity 检查
- 色彩/光影统一性检查
- 反空洞词检测
输出格式
单个分镜输出
【导演解读】
功能:
转折点:
POV/共情:
权力:
潜台词:
单一意图句:
【最终漫剧分镜提示词】
一整段完整、可复制使用的中文提示词。
【镜头参数摘要】
摄影机质感:
焦段:
光圈:
景深:
对焦位置:
背景虚化:
适合原因:
【连续性记录】
clip_id:
observed_end_state:
open_motion_vector:
extension_depth:
completed_beats:
reserved_future_beats:
加载映射(Load Map)
| 情况 | 加载 |
|---|---|
| 模糊想法或缺少简报 | seedance-interview-short |
| 需要单镜头分镜 | 直接本技能 + directing-engine |
| 多镜头序列/续集 | seedance-sequence + sequence-project-state + continuation-handoff |
| 审查生成结果 | retake-protocol + failure-atlas |
| 需要特定元素专项(镜头/灯光/角色/VFX) | 对应 seedance-* 子技能 |
| 角色设计卡 | references/character-design-sheet.md |
| 反空洞词检测 | anti-slop-lexicon |
关键规则(12条)
- 先过五问,再动笔写提示词 — 没有导演解读的镜头是装饰
- 一个意图,全员同频 — 镜头/灯光/表演/声音必须指向同一感觉
- 情绪必须转化为行为 — AI渲染的是可见动作,不是"她悲伤"这种词
- 用户不是状态传感器 — 附件一到,Agent直接从画面读状态,不问多余问题
- 观察到的实际结尾 > 计划结尾 — 不接受的素材不构成 canon
- 拒绝的素材永远不是 canon — 不能成为续接的父级
- 连续性问题优先于完美问题 — 角色漂移比光线差更致命
- scene 边界 = 重锚点 —
extension_depth重置为 0 - 每次只改一个变量 — 一变量规则,否则结果不可读
- 提前设好尝试预算 — 避免无限迭代烧钱
- 参考标签逐字节保留 —
@Image1不被归一化、翻译、重编号 - 完成节拍排除,预留节拍不泄露 — Clip 01做了的事,Clip 02不再做
与 opengod 的集成方式
本技能作为 video-production 和 seedance-directing 模块的核心子技能被 opengod 加载:
用户:"帮我做漫剧"
↓
OpenGod 0层 → L4 复杂任务
↓
OpenGod 1层 → 识别为"漫剧"领域
↓
OpenGod 2层 → 路由加载: video-production + seedance-directing
↓
实际执行 → AI Manju Studio v1.0(本技能)
↓
每个镜头生成 → 可选裂变(多集并行撰写)
↓
质量裁判 → 9层检查
↓
64聚合 → 交付
版本: v1.0 (2026-07-25) 数据来源: Emily2040/seedance-2.0 v6.6 + opengod v11.1 裂变架构 核心理念: Direct the model. Don't micro-manage the frame.