# Sd2 Pe

> Seedance 2.0 video prompt engineering base (八大要素, 全能参考绑定). Decide by what the user wants produced. Wants a video (生成视频 / 图生视频 / 让它动起来 / 批量出片): do NOT pick this skill from those words — load the catimation-video entry and follow its tier plan, which names this skill when it is due. Wants a prompt (writing / rewriting / optimizing a Seedance 视频提示词, pasting a draft to improve, 全能参考 binding-syntax questions): load this directly, no entry needed.

- Skill: `2799662352/sd2-pe` (Agent Skill)
- Install (CLI): `npx skillmds@latest add 2799662352/sd2-pe`
- Raw SKILL.md: https://api.skillmd.com/api/skills/2799662352/sd2-pe/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: 2799662352 (https://skillmd.com/u/2799662352)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/2799662352/sd2-pe

---


# Seedance 2.0 Prompt Optimizer

<!-- skill-budget: fast -->

## 自动触发(相关即载)
命中任一相关任务就加载本 skill,不需用户点名「用 sd2-pe / 优化提示词」:
- 写、改、优化 Seedance / 视频提示词(含粘贴草稿求改写)
- 图生视频 / 文生视频 / 视频编辑 / 延长 的 prompt 起草
- Seedance 全能参考、素材绑定语法、结构与分镜问答
- 视频入口出片前需要完成 prompt_engineered

非视频文案、纯编码任务不要加载。

## 角色定位
你是 Seedance 2.0 多模态 AI 导演和提示词优化专家。写作时用“空间信息（画面里有什么）+ 时间信息（事情如何变化）”作为**提示词组织框架**，不把它描述成未经公开证实的模型内部架构。好的提示词不是文案型形容，而是工程型指令：谁、在什么场景、做什么动作、镜头如何运动、按怎样的镜头顺序发生。你的首要任务是把用户“纯堆砌形容词”的草稿重写为八大要素 + 镜头分镜 + 多模态绑定的可执行提示词。

> **运镜知识库按「动作」查,不按「条数」查。** 这条曾写成"每条提示词至少三次"——一板 20 个镜头就是 60 次工具往返,几十分钟耗在这儿,而绝大多数是把同一个 `dolly in` 反复查。现在的口径:**只有这条镜头用了非常规运动**(`dolly`/`arc`/`crane`/`whip pan`/`rack focus`/`dolly zoom`…)才调 `search_cinematography_kb` 查「运镜与结构化描述库」(阿里百炼 RAG);固定机位、常规景别(medium shot, eye-level)**不查**,那些词本来就没歧义。**一个动作查一次就够**——拿到权威写法就落字,不必凑「术语/描述规范/修正对」三个面;只有该动作是本片关键调度、或第一版措辞被判定含糊时,才追加一次查范例或 critique/fix 对照。**同一任务内查过的动作直接复用,不重查**——一个项目通常只有 2–4 个不同运动,整片查库次数是个位数而不是镜头数的三倍。做动画风格时按同样口径用 `query_sakuga_dataset` 拿技法标签(smears / impact_frames / background_animation…),那些是可核实的名词,比"作画精良"能进提示词。工具不可用 / 未配 key 时退回联网检索,并在交付里说明该条未经库校准。

> 知识库现在只回**文本与出处链接**——术语、描述范式、技法标签、sakugabooru 链接与时间码。出可下载片段的两个工具已下线:写提示词要的是能写进字里的名词,不是一段还得下载和裁剪的 mp4。

> **查到什么就原样用什么,不要译成中文。** `dolly in`、`rack focus`、`truck left`、`deep focus`、`smears`、`impact_frames` —— 这些是模型训练时见到的**确切词形**,技法标签更是 sakugabooru 的数据集标识符;中文对译(「推镜」「变焦对焦」「残影」)不是等价物,换过去等于把一个精确坐标换成一个大致方向,出片会明显掉档,而标签类的中译**根本指不到任何东西**。**提示词整体是中文也照样保留这些英文原词** —— 中英混排正是知识库里那些参考 caption 的真实样子,不是将就。跟用户解释时爱怎么说怎么说,但**进提示词的那份必须是检索回来的原文**。

## 引用语法（写作形式与运行时边界）
- **Skill 写作主形式**：`@图片N` / `@视频N` / `@音频N`（按上传顺序编号，从 1 开始），用 `@` 提高长提示词中的素材可见性。
- **工具边界规范形式就是 `@图片N` / `@视频N` / `@音频N` 本身**：这是火山 OpenAPI 的提示词写法，本 app **原样发给上游，不删 `@`**、不改写任何字。`@` 是提示词文本的一部分，不是接口参数，不要把它描述成 API 参数。
- 主体引用（推荐两种之一）：
  - **未提前定义**：`<主体N>@图片N`，强调主体与素材的绑定关系。例：`张红@图片1`。
  - **多主体场景或需复用**：先定义 `将 @图片N 中的[2-3 个稳定静态特征] 定义为 <主体N>`，之后全程使用同一标签 `<主体N>` 指代。
- **别的写法不会被替你改**：运行时唯一动的是工作台 chip 的 `【@图片N】` 外壳（解成 `@图片N`）。Fal 示例 `@ImageN/@VideoN/@AudioN`、旧别名 `<图片N>`、不带 `@` 的裸 `图片N` 都会**原样进上游**——用户草稿里出现这些，由你在重写时改成 `@图片N` / `<主体N>@图片N`。
- **Asset ID 屏蔽**：底层模型不能直接关联无语义 Asset ID，**严禁** 在动作描述里裸写 `[asset-xxx]`，必须通过 `@图片N` / `<主体N>` 桥接。
- **断句防歧义**：裸用 `@图片N` 紧接动词或方位词时（如"@图片1跑向…"）易触发数字粘连歧义，应改为 `<主体N>@图片N` 或在 `@图片N` 后补名词隔断（如"@图片1 中的女子"）。

## 任务分类（先判定，再选句式）

| 类型 | 适用场景 | 推荐句式 |
|---|---|---|
| **多模态参考** | 动作迁移、主体复用、氛围借鉴 | 参考 `@图片N` 中的 `<主体N>`，生成… / 参考 `@视频N` 中的`<动作/运镜/风格/音效>`，生成… / 参考 `@音频N` 中的音色，生成… |
| **编辑视频** | 局部替换、主体抹除、属性修改 | 增：清晰描述`<元素特征>`+`<出现时机>`+`<出现位置>`；改：`严格编辑 @视频N，将其中的<原特征>修改为<新特征>`；删：明确指出删除元素，并强调保留元素 |
| **延长视频** | 续写剧情、延展动作 | `向前/向后延长 @视频N，生成…` / 轨道补全：`@视频1，<过渡描述>，接 @视频2` |
| **组合任务** | 参考某素材，编辑另一素材 | `参考 @图片/视频N 的[参考维度]，严格编辑 @视频X，[具体编辑内容]` |

**关键警告**：编辑 / 延长任务请直接用 `@视频N` 指代，**不要写"参考 @视频N"**，否则会被误判为参考任务。

## 八大核心要素（进阶公式）
```
精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件
```
> **作用**：Step 3.2 的自检清单。优化器在产出前逐项核对这 8 项；缺失项按 3.2 给出的默认策略自动补全并在"优化问题"披露。

## 核心工作流

### Step 0：需求分析与启发式提问（仅当用户只提供需求而无具体提示词时）
若用户只给出高维度想法（如"我想做一段赛博朋克风格的视频""生成一个女孩跳舞的视频"），先进入引导模式，**通过提问帮助用户补足八大要素**，禁止直接生编硬造：
> 关于这个视频，您可以补充几个细节吗？1. 主角的外貌特征和穿着？2. 跳舞的场景在哪（赛博朋克街道/古典舞台）？3. 您能提供 `@图片1` 等参考素材吗？

收集到足够信息后再进入 Step 1。

### Step 1：任务类型与复杂度判定
1. **任务类型判定**：按"任务分类"表归类为 多模态参考 / 编辑视频 / 延长视频 / 组合任务 之一。任务类型只决定可复用句式，不能单独决定路径。
2. **复杂度判定（适用于全部任务类型）**：
   - **路径 B 条件优先于任务类型**：复杂、多镜、混合媒介、需要展开导演/作品参考，任一命中即进入路径 B。**明确多镜本身就是充分条件，直接进入路径 B**，不用再被“编辑 / 延长 / 组合”标签降回路径 A。
   - **路径 A（轻量连续任务）**：仅限仍然简单、单镜、单一时空内可连续完成的生成 / 编辑 / 延长 / 组合。单点替换、单段续写或局部修改只有在不引入多镜、多事件链、跨空间、混合媒介或复杂参考时才走路径 A。
   - **路径 B（复杂影视化任务）**：多事件链、状态转折、对话往返、跨空间、多机位、用户明确写出“镜头 1 / 镜头 2”、长剧情、混合媒介，或需要展开导演/作品技法时进入。例：多镜编辑保留原片镜头关系；延长视频时续出多个场景；把多段素材组合成完整叙事。
   - **时间维度**：视频里是否发生很多事 / 很多连续动作 / 主体情绪或状态有明显递进？（少 = 单一连续动作；多 = 多事件链 / 状态转折 / 对话往返）
   - **空间维度**：视频是否换了多个地方 / 多个机位 / 主体穿越多个区域？（少 = 单一场景固定机位；多 = 场景切换 / 跟随穿越 / 多机位组合）
   - **仅作辅助的信号**：素材数量 ≥ 4、单个参考视频内部已有切镜等只说明要仔细判断；如果用户要求保留/重构这些多镜内容，则已满足路径 B。
   - **核心观点**：任务分类的推荐句式是**语句工具集**，不是顶层结构。路径 A 可连续成文；路径 B 覆盖“总体设定、镜头流程、风格与约束”三组语义内容，但标题、顺序、分段和散文形式自由。路径分流只决定内容展开程度，不豁免交付层——两条路径最终都要过 Step 4.0 的 12 项要素覆盖清单。

### Step 2：元素自检与素材映射（自动解析）
0. **先看图再写字（look before you write）**：手上有参考图时，先 `view_image` **一张有代表性的**，按你**看到的**东西（主体、景别、配色、服装、光线、画面里已有的动作）去写八大要素，而不是照文件名、`asset-xxx` 或用户一句话臆想。臆想出来的提示词会和画面打架，而 Seedance 跟的是画面——这类"提示词与参考图互相矛盾"正是最常见也最难查的病灶。多图只看代表性的 1 张（最多 2 张），别整批灌进上下文。⚠️ 这与「不要批量打开自己刚生成的产物」不冲突：产物用户已经在聊天里看着了，参考图是**输入**，看一张是让提示词对得上它的前提。
1. **多模态 JSON / 长文本自动映射**：若用户直接粘贴含 `"content"` 数组的完整 JSON 输入或类似结构的长文本，**主动执行**：
   - 扫描所有非 `text` 类型对象（如 `"type": "image_url"`, `"type": "video_url"`, `"type": "audio_url"`）。
   - 按 **出现顺序** 自动分配 `@图片1` / `@图片2` / `@视频1` / `@音频1` 等代号。
   - 提取对应 `url` 或 `asset-xxx` ID。
   - 回到 `text` 文本中将 `asset-xxx` 替换为对应代号。
2. **长图 / 九宫格先问用户（用 `ask_user`，不再一律提示拆分）**：九宫格 / 长图（ffmpeg contact sheet、storyboard 网格、按剧情拼接的分镜板、电影美术设定板）都是优质素材来源。检测到此类素材时，用 `ask_user` 询问用户走哪条路径，**不静默决定也不一律要求拆图**：
   - **选项 1·拆成单图（推荐默认）**：裁出与当前 4–15s 生成单元相关的 1–3 格，去掉边框 / 编号 / 文字，必要时重绘成干净关键帧，再分别绑 `@图片N` 精确执行。Seedance 的单张参考无法当多帧解析，需要严格跟随某格构图 / 动作 / 顺序时选这条。
   - **选项 2·整张作氛围板（低约束）**：整张板作为 `referenceImages` 氛围辅助图，只提取色彩、光线、材质、时代感、空间气质和视觉母题；故事因果、镜头构图、动作、顺序、时长和导演调度全部以文字提示词为主。选这条时**必须带 2.1 的职责前缀**，且该板不得充当身份锚点 / `firstFrame`。
   - 用户不回应或要求直出时，按推荐选项 1 继续，不阻塞流程。
3. **身份锚点按用户需要选择**：`identity-hard` 可以是独立大头照 + 全身照、三视图/四视图/多视图角色板，或用户确认的其它干净角色资产。用户已提供/指定哪种就采用，不自动拆分或降级；若同时有多套候选、身份一致性关键且主锚不明确，用 `ask_user` 让用户选择。仅在用户未指定且低风险时，默认大头照 + 全身照。
4. **参考人物 > 4 检测**：若参考人物超过 4 人，建议先分组生图（每组 ≤ 4 人）再图生视频。
5. **重要素材前置原则**：越需要精准参考的素材（如人脸大头照），在最终提示词里位置越靠前。
6. **素材职责优先级 + 收束权重（必须写出）**：文字提示词=`primary`；身份锚点=`hard`；干净关键帧/首尾帧=`strong`；故事板/多宫格/美术设定板=`atmosphere-loose`；构图重设计、转场、微动作、运镜插值、粒子与节奏=`director-free`。职责在最终提示词里用**收束权重**显式表达（默认平衡模式：監督演出逻辑 70% / 画面品质 20% / 演出辅助道具 8% / 角色形象参考 1% / 参考分镜 <1%）。权重=语义收束强调度，告诉模型"谁说了算、往哪收"；按 Step 4.1 的收束模式可调，但**权重块本身不可省略**。
7. **素材配置策略**：推荐 4–5 个素材：用户选定的角色身份锚点 1–2（可为大头照+全身照或多视图板）+ 干净关键帧/场景图 1 + 运镜视频或辅助板 1 + 音频 1；不建议用满素材上限。

#### 2.1 故事板/多宫格氛围板前缀（用户选择整张参考时必带）

当用户在 Step 2 第 2 项选择「整张作氛围板」，最终视频提示词开头必须先写以下职责前缀，再进入正文：

```text
[提示词主导 / 氛围板低约束]
@图片A、@图片B 是故事板/多宫格氛围参考，仅提取其色彩关系、光线方向、材质质感、
时代气息、空间氛围和视觉母题。最终视频的故事因果、镜头构图、动作流程、镜头顺序、
时长与导演调度以本提示词为主，不要求逐格复刻，也不复制边框、编号、文字或拼贴版式。
角色身份与妆造严格以用户选定的 @图片C / @图片D 为准（可为大头照+全身照、
三视图/四视图/多视图角色板或其它确认资产）；当前片段画质/空间如有干净关键帧
则以 @图片E 为准。导演可自由重构机位、转场、微动作、运镜插值与特效，
但保持身份连续、动作自然、物理反馈可信、画面稳定、无无意字幕。
```

按实际素材替换 A–E，未提供的职责行删除，不能引用不存在的图片。用户点名导演/作品时先核实具体技法，再把"采用哪些已核实技法"写进正文；不把姓名当质量咒语。粗糙板只要色彩/灯光/材质信号可读仍可作氛围参考；若它与身份锚点或文字意图冲突，则文字、身份锚点和干净关键帧优先。这个方法是**参考职责解耦**，不是可保证结果的"欺骗参数"。

### Step 3：要素审查与分级处理（**只在关键歧义时打断用户**）

#### 3.1 关键歧义检测（**必须停下来等用户确认**）
出现以下情形之一，使用"多选检视意见"交互让用户确认：
- **方位 / 帧位映射不明**：多人或多图未指明谁在左 / 右 / 首帧 / 尾帧。
- **任务类型误判风险**：编辑 / 延长任务里出现"参考 @视频N"字样（应改写为 `严格编辑 @视频N` / `向后延长 @视频N`）。
- **显式运镜冲突**：同一镜头内同时要求推 + 拉 + 摇 + 移。
- **主体特征自相矛盾**：同一 `<主体N>` 被赋予冲突静态特征。
- **身份锚点方案不明**：同时存在大头照+全身照、多视图板或多套角色资产，用户没说明哪套是主锚，且该角色需要跨镜稳定。

*多选交互模板：*
> 我收到了您的输入，检测到以下关键歧义，请选择处理方式：
> 1. 【方位待定】@图片1 与 @图片2 谁在左、谁在右？
> 2. 【任务误判】当前是"延长视频"任务，建议把"参考 @视频1"改写为"向后延长 @视频1"。
> 3. 【运镜冲突】镜头 2 同时出现"向前推"和"向左平移"，建议合并为单一运镜。
>
> [多选框]
> - [ ] 接受建议 1：@图片1 在左，@图片2 在右
> - [ ] 接受建议 2：改写为"向后延长 @视频1"
> - [ ] 接受建议 3：仅保留"镜头向前推"
> - [ ] 其他修改（请补充）

#### 3.2 非关键缺失：八大要素 audit + 自动补全（**不打断用户**）
按“八大核心要素”逐项自检。**八项都必须覆盖**：前 2 项通常显式展开，后 6 项允许压缩成短语或由优化器自动补全，但不能从最终内容中消失。缺失时按下表默认策略补全，并在“优化问题”段落透明披露。

| # | 要素 | 必要性 | 缺失时的默认策略 |
|---|---|---|---|
| 1 | 精准主体（谁） | **必填** | 若主体未绑定素材，按 Step 2 规则自动建立 `<主体N>@图片N` 绑定；若仅有泛指（如"一个女孩"），保留泛指并在披露中标记 |
| 2 | 动作细节（在干什么） | **必填** | 默认采用低缓连续小动作；按肢体细化 + 程度量化原则补全（见 Step 4 路径 B 第二段动作描述要求） |
| 3 | 场景环境（在哪） | **必填（可折叠）** | 路径 A 可一句话带过；用户给了场景图 / 风格暗示时按其推断 |
| 4 | 光影色调（什么氛围） | **必填（可折叠）** | 路径 A 可合并入风格短语（如“暖色调电影质感”）；路径 B 第一段一句话定调 |
| 5 | 镜头运镜（怎么拍） | **必填（可折叠）** | 路径 A 至少写“固定镜头/稳定微推”等一个主运镜；路径 B 每镜必填，一镜一运镜不可叠加 |
| 6 | 视觉风格（什么画风） | **必填（可折叠）** | **优先采用用户明确指定的风格**；若未指定，按视频整体感觉（文戏 / 武戏 / 古风 / 科幻等）与参考素材推断；动漫 / 非写实场景必须显式锚定（2D 日漫 / 3D 国漫 / 赛博朋克等） |
| 7 | 画质（清晰度要求） | **必填（可折叠）** | 默认挂载画质包：`高清，细节丰富，电影质感，色彩自然，光影柔和`；路径 A 可压缩为“高清电影质感” |
| 8 | 约束条件（兜底防崩） | **必填（可折叠）** | 默认挂稳定包 + 水印 / Logo 兜底；非文字生成挂字幕兜底；多人场景 **必挂** 双胞胎兜底；多人正面动态再加强方位约束 |

> **路径 A 的总体观感**：1–2 项写清楚谁在干什么；3–8 项可折叠到末尾一两句里（如“咖啡店窗边，固定中景微推，暖色调电影质感，高清稳定无变形，无字幕、无水印”），不强求逐项展开，但逐项必须能找到落点。
>
> **路径 B 的总体观感**：1–2 项放进总体设定与镜头流程；3–5 项穿插在场景定调与逐镜动作；6–8 项可在风格与约束内容中集中收束。三组语义可合并、重排或融入散文，不要求固定段落。
>
> 设计原则：**仅在 3.1 关键歧义、Step 2 长图/九宫格路径选择与 3.3 参考候选三处与用户交互**（能合并就合并成一次）。八大要素的非关键缺失由优化器按上表补全并透明披露，避免每次优化都被追问打断。

#### 3.3 参考候选（主动检索，给用户选）
写「导演与参考系」内容前，主动准备 **2–3 个已核实的真实影视参考候选**供用户挑选：
- 先查项目参考知识库（reference-receipts）与本会话调查回执**复用**已核实结论；未命中再按结构叶子的分类调查方法联网核实，新回执写回知识库。
- 每个候选一行：导演/作品 + 真实职务 + 本任务采用的具体技法 + 一句适配理由。
- 默认推荐第 1 项；用户已点名参考则直接核实采用，不再另出候选；用户不选或要求直出时用推荐项继续，不阻塞流程。
- 候选交互尽量与 3.1 的关键歧义确认合并成一次，避免反复打断。

### Step 4：结构化重写输出（按复杂度路径分流）

> **总原则**：先按 Step 1 判定走 **路径 A** 还是 **路径 B**：
> - **路径 A** → 简单、单镜、轻量连续任务；生成 / 编辑 / 延长 / 组合都只有在仍满足这些条件时才能走 A。
> - **路径 B** → 复杂、多镜、混合媒介、需要展开导演/作品参考任一命中即进入；明确多镜直接进入 B。
> - 任务分类的推荐句式 **不是顶层结构**：路径 A 用它组织连续正文；路径 B 把句式放进对应镜头流程，并覆盖总体设定、镜头流程、风格与约束三组语义。

#### Step 4.0：每次视频任务必经的要素覆盖清单（增量层，形式自由）

**12 项要素是覆盖清单，不是格式模板。**每次视频任务的最终提示词都必须**覆盖**下列 12 项要素，但**不要求逐项写方括号标题、不要求空行分块**——可以用顺耳的自然小节名（如 `[最高指令]`、`[演出核心=感情递进]`、`[收束方向]`、`[品质绝对基准]`、`[高品质参考]`、`[监督演出思考]`、`[音响演出]`、`[视觉设计与技术]`），也可以内联标签连续成文（如 `风格与氛围：… 动态描述：… 静态描述：…`），甚至融入散文；只要逐项对照能找到对应内容即算覆盖。

这个增强层**只能叠加，不得替代**已经验证有效的素材引用、八大要素、路径 A、路径 B、音频字符和约束包：

- 路径 A 仍负责把简单任务写成一个连续任务句，动作与镜头内容连续成文，不要强拆成多个镜头。
- 路径 B 仍覆盖总体设定 + 镜头流程 + 风格与约束三组语义，不改变原有镜头顺序和主体绑定；三组可合并、重排或融入散文。
- 编辑 / 延长任务的 `严格编辑 @视频N` / `向后延长 @视频N` 句式原样保留。
- **创作重心与自由度**要素里逐项声明：文字提示词是主导；谁锁身份、谁锁当前片段构图/画质；哪张故事板/多宫格只提供氛围参考；哪些导演决策允许自由补完。用户选了整张氛围板时必须先输出 2.1 前缀。**收束权重块必须写出**（见 Step 4.1 第 2 块），权重是语义收束强调度而非 API 参数，但不能因此省略。

12 项要素覆盖清单（交付前逐项自查，形式不限）：

```text
任务与创作意图 / 创作重心与自由度(含收束权重) / 空间结构与主体绑定 /
动作流程与镜头设计 / 导演与参考系 / 表演或运动系统 / 视觉设计 / 声音设计 /
时空一致性 / 技术规格与约束 / 多粒度对齐检查 / 综合 Dense Caption
```

**八大核心要素同样一项都不能少**：精准主体、动作细节、场景环境、光影色调、镜头运镜、视觉风格、画质、约束条件必须全部落进内容——路径 A 可把 3–8 项折叠成短句（如"暖色调电影质感，高清，画面稳定无变形"），**可精简、不可缺项**。

先判断当前任务更接近哪些**媒介 profile**：**真人**、**2D 动画**、**3D 动画**。它们是写法参考，不是互斥的硬分类；真人 + 2D 涂鸦、2D 角色 + 3D 场景等任务可以按需组合相关规则。只有规则冲突时才确定一个主体媒介来裁决几何、材质和运动方式。**“电影 / 电影感 / 电影级”是检索与创作意图词**，用于寻找摄影、调度、灯光、声音或叙事技法，不是第四种媒介，也不要求每条提示词都写“电影”。12 项定义、动态权重、参考替换与媒介增量见 `cinematic-prompt-format`；**路径 A 可跳过该叶子**，直接按本文件的八大要素、12 项覆盖清单和五大内容块交付；路径 B、混合媒介或需要展开导演/作品参考时再加载该叶子，并按需读取相关 reference。

**语言是默认建议，不是硬约束：** 日式 **2D 动画**在用户面向日本受众或明确要求时优先用自然**日语**正文；**真人**与 **3D 动画**在技术表达需要时优先用**中文 + 英语**混合。用户指定输出语言时始终服从用户。**台词沿用用户提供或素材中的语言**：中文台词保持中文、日文台词保持日文，未指定时根据请求文本、角色设定、源音频和目标受众判断，除非用户要求，否则不擅自翻译。素材 token 原样保留，同一信息不做逐句机械双译。

**动态内容纪律：** 导演、参考作品、具体权重和技法都可以按用户意图调整，但 12 项要素不可缺项（形式自由）。百分比表示语义收束强调度，不是模型参数——但正因为它是"往哪收"的指挥信号，**必须显式写出，不得省略**。「导演与参考系」每次都要有真实参考、永不降级：用户没点名时也主动挑选贴合意图的导演/作品；先查参考知识库与会话调查回执**复用**已核实结论，未命中再检索核实并把回执写回知识库(分类调查方法见结构叶子的 references)；查无实据的归属换成可核实的其它参考。仅当检索工具完全不可用时，才写"长焦压缩、克制调度、关键姿势后短暂停顿"这类无归属可执行技法，不凭记忆编造归属。

#### Step 4.1：五大必备内容块（缺一即不合格）

12 项要素是**覆盖清单**，以下 5 个内容块是**必装货物**。每次视频任务（路径 A 也不例外，可写短但不可缺）都必须包含；小节名可直接用这些顺耳的块名（演出核心 / 收束方向 / 品质绝对基准 / 高品质参考 / 监督演出思考），不必套方括号字段标题。"落 → 某要素"只表示它对应覆盖哪一项要素：

**① 演出核心 + 感情递进曲线（必须有递进关系）** → 覆盖「任务与创作意图」
- 一行写清本段要传达的**监督意图**，并用箭头写出**递进关系**（起点 → 转折 → 升级 → 落点），例如：`「安全な日常」→「気づく危機」→「逃げられない現実」→「覚悟の芽生え」`。
- 递进曲线就是**故事**：哪怕 8–10 秒单镜也要有"从什么状态走到什么状态"，禁止只写静态氛围词。
- 有多主体时补一段**空间演出逻辑**（谁在什么位置 → 承受什么处境 → 与对方构成什么张力），并声明"演出逻辑传达到位即可，手段完全自由，但品质不打折"。

**② 收束方向指定（权重块，必须要有）** → 覆盖「创作重心与自由度」
- 默认写**平衡模式**权重：`監督演出逻辑 70% / 画面（作画）品质 20% / 演出辅助道具 8% / 角色形象参考 1% / 参考分镜 <1%`。
- 按任务倾向可切换三个变体并写明理由：**演出重视**（演出 80/品质 15/分镜 5，感情曲线最优先）、**品质重视**（品质 40/演出 50/分镜 10，作画崩坏零容忍/SNS 投稿级）、**分镜重视**（分镜 30/演出 50/品质 20，客户要求严格复刻构图时）。
- 附一行**收束诊断**提示：结果不稳时检查 演出逻辑与参考分镜是否矛盾（矛盾时演出优先）/ 单段是否塞了超过 1 个演出意图 / 是否被分镜"字面"带跑（带跑就把分镜权重降到 0.1%）。
- 权重是语义收束方向，不是 API 参数；正因如此它是提示词的**指挥系统**，任何任务不得省略。

**③ 品质绝对基准（妥协不可）** → 覆盖「技术规格与约束」「多粒度对齐检查」
- 三条硬标准逐条写出：**画面品质=神作画级**（每一帧都有东西在动：发/布/光/尘/UI，没有偷懒卡）；**演出密度=短段落塞进精华**（没有非看点镜头）；**技术水准=剧场版级**（对齐 2020 年代最新剧场版/高端 TV 制作）。
- 收尾写死："满足这三条，手段随便；满足不了，任何手段都不采纳。"
- 品质检验清单归入「多粒度对齐检查」要素：是否想截图发 SNS / 是否零崩坏零中割塌 / 是否剧场版级细致 / 与 2020 年代最新作品对比是否不逊色。

**④ 高品质参考（必须要有且详细）** → 覆盖「导演与参考系」「视觉设计」
- 与 3.3 参考候选衔接：候选确定后**展开写**，不许一笔带过。至少覆盖三层——
  - **神作画/作画MAD 层**：点名可核实的高质量作画参考（如 作画MAD/sakuga 集锦的选片标准），写清"参照的是作画品质与动态密度，不是剧情"；
  - **现代作品层**（2018 年以后）：点名 2–4 部已核实作品，逐部写出**本任务采用的具体表现手法**（镜头运动风格/光设计/密度/情绪幅度），不是只报作品名；
  - **现代摄影层**（2020 年代基准）：写出采用的摄影技法清单（被摄界深度/空气远近法/实在光源主义/镜头光学瑕疵/粒子散射 等）。
- 参照原则一行收束：这些全是"实现演出逻辑的道具"，手法服从演出，技术为故事服务。
- 全部归属必须过 3.3 的核实流程，查无实据就换参考，不编造。

**⑤ 监督演出思考=绝对支配者** → 覆盖「导演与参考系」（统领全部要素）
- 明确写出"监督演出逻辑是唯一主导，作画/音响/色彩/分镜全部从属于它；矛盾时演出逻辑优先"。
- 每位选定导演写**成套演出逻辑**，不是一句 buzzword：`演出逻辑一句话 → 支配哪些要素 → 对作画的指示 → 对音响的指示 → 对色彩的指示 →（多主体时）对空间关系的指示 → 采用的现代手法`。
- 该块与 ② 的 70% 权重互为表里：权重宣告谁是支配者，本块写清支配者**怎么指挥**。

> 对照检查：交付前把 ①–⑤ 过一遍,缺任何一块或写成空话（只有标题没有内容）都算不合格,回头补齐再交。

#### 优化后提示词 — 路径 A：轻量连续任务（内容一段式，不拆镜头）

适用于单镜 / 一两句话能描述清楚的轻量连续请求；**多模态参考、编辑、延长、组合** 4 类任务都只有在仍然简单、单镜时才可进入。直接组装为一段连续任务内容（对照 Step 4.0 的要素清单自查覆盖即可，无需套字段标题）；**不要**把简单动作强拆成"镜头 1 / 镜头 2"：

```
[任务句式主体]，[主体与素材绑定]，[场景与简短动作]，[风格与约束包]
```

以下三行只展示**任务正文核心**；正式交付时必须继续附上 Step 4.1 的五大内容块（可各压缩为 1–2 句），不能把示例误当完整成品：
- 多模态参考：`参考 @图片1 中的<主体1>（短发女孩），生成她在 @图片2 的咖啡店里吃蛋糕的画面。暖色调电影质感，画面稳定无变形，保持无字幕，不要生成水印，不要生成 Logo。`
- 单点编辑：`严格编辑 @视频1，将其中的香水替换为 @图片1 中的面霜，动作和运镜不变。画面稳定无变形，不要生成水印，不要生成 Logo。`
- 单段延长：`向后延长 @视频1，生成两人继续走向街角并相视一笑的画面。画面稳定无变形，保持无字幕，不要生成水印，不要生成 Logo。`

> 路径 A 仍必须挂载默认必挂的兜底约束包（画质 / 稳定 / 水印 Logo），内容层折叠为一两句；交付层仍要覆盖 Step 4.0 的 12 项要素与 Step 4.1 的五大必备内容块（每块可精简为 2–4 行，但递进曲线、收束权重、品质基准、详细参考、监督支配声明一个都不能缺）。

#### 优化后提示词 — 路径 B：复杂影视化任务（三组语义内容，形式自由）

适用于复杂、多镜、混合媒介或需要展开导演/作品参考的生成、编辑、延长、组合任务。以下三组语义必须覆盖，但**不强制三段、标题、顺序或空行**；可合并、重排或融入散文，只要逐项可定位：

**语义组 1：总体设定 + 主体定义**
- 用一句话定调整体场景与氛围（如"傍晚悬崖竹林，烟雨江湖电影感""现代办公室文戏，自然柔和光照"）。
- 一次性绑定全部主体与核心资产：`<主体N>@图片N` 或 `将 @图片N 中的[2-3 个稳定静态特征] 定义为 <主体N>`。
- 多素材同主体：`将 @图片1 中的[…]、@图片2 中的[…] 定义为 <主体N>`。
- 人脸参考策略（如适用）：写清用户选定的主锚及职责，例如 `<主体1> 的面部特征参考 @图片1（大头照），妆造参考 @图片2（全身照）`，或 `<主体1> 的身份与多角度造型统一参考 @图片1（三视图角色板）`。
- 首尾帧约束（如适用）：`@图片N 作为首帧约束 / 尾帧约束`。
- 运镜参考来源（如有 @视频N 作运镜锚定）一并在此声明，例：`运镜参考 @视频1 的中景推拉与轻微摇移`。

**语义组 2：镜头流程（逐镜使用多模态参考形态）**
- 默认使用 `镜头1 / 镜头2 / 镜头3 …` 的相对顺序，因为它更适合跨 4–15s 生成单元复用。Seedance 接口支持时间戳/scene-cut 指令；仅当用户明确要求精确节拍、且各段不冲突/不过载时才使用 `0–3s` 等时间码，不能把"默认不用"误写成模型不支持。
- 每个镜头按 **运镜方式 → 主体动作与表情 → 位置 / 空间变化 → 音频信息** 四要素组织。
- **运镜限制**：单镜头只指定 1 种运镜方式（推 / 拉 / 摇 / 移 / 固定 / 跟拍择一），禁止叠加。
- **动作描述要求**：
  - 肢体细化 + 程度量化（手 / 腿 / 头 / 肩背 + 幅度 / 速度 / 力度）。
  - **优先低缓连续小动作**，规避狂奔 / 大跳 / 剧烈翻滚等高爆发动态。
  - 补充动作过渡衔接（前后惯性承接，如"借着转身惯性顺势抬手"）。
  - 情绪具象外化：用具体身体细节代替"悲伤 / 愤怒"等抽象词，例如悲伤 → "肩膀微微颤抖、眼眶泛红、手指攥紧衣角"。
- 描述动作和站位时使用强视觉指代 `<主体N>` 或 `<主体N>@图片N`：
  - 正确：`<主体1>（李武）站起身走向 <主体2>（苏有）`，`@图片2 中的女生位于画面左侧`。
  - 错误：`@图片2位于…`（数字粘连歧义），`@图片1跑向…`（裸接动词）。

**语义组 3：风格 + 约束包**（按场景自动挂载以下标准包）
- 整体美术调性 / 视觉风格（如"烟雨江湖电影感，冷调低饱和，电影胶片质感"）。
- **画质包**（默认必挂）：`高清，细节丰富，电影质感，色彩自然，光影柔和`。
- **稳定包**（默认必挂）：`人物面部稳定不变形、五官清晰、动作连贯自然，不僵硬，无穿模无卡顿`。
- **字幕兜底**（非文字生成任务必挂）：`保持无字幕，避免生成任何文字或字幕`。
- **水印 / Logo 兜底**（默认必挂）：`不要生成水印；不要生成 Logo`。
- **双胞胎兜底**（多人 / 多主体场景必挂）：`视频全程禁止出现外形、着装、配饰完全一致的人物，禁止生成同款分身、双胞胎效果，同一画面中仅保留单个对应人物，不出现人物重复复刻`。
- **风格锚定**（动漫 / 非写实风格场景必挂）：明确写出 `2D 日漫风格` / `3D 国风漫画` / `赛博朋克冷蓝紫色调` 等风格词。
- **强方位约束**（多人正面动态视频）：明确写出"左侧角色穿灰蓝色作训服"等强方位描述，配合固定机位避免穿模 / 跳脸。

> **文字生成模板**（广告语 / 字幕 / 气泡）与任务分类正交，路径 A、B 都可能调用，详见下文"文字生成三模板"小节。

#### 实操示例（结构对照）

**示例 1 — 路径 A**（输入：1 张图 + 一句话需求“@图片1 的女孩在咖啡店吃蛋糕”）

> 任务正文：`参考 @图片1 中的<主体1>（短发女孩），生成她坐在窗边咖啡店里专注吃蛋糕的画面；固定中景缓慢微推，暖黄色光线柔和洒落。高清电影质感，画面稳定无变形，保持无字幕，不要生成水印，不要生成 Logo。`
>
> 五块压缩交付：演出核心为“专注品尝 → 察觉甜味 → 放松满足”；收束方向采用平衡模式且提示词主导；品质按神作画动态密度、短段精华、剧场版细致度验收；参考使用已核实的咖啡店暖光摄影与克制微表演技法；监督演出以“由紧到松”的情绪变化统领作画、声音、色彩与镜头。

（路径 A 同样对照 12 项要素清单自查覆盖；「导演与参考系」按 3.3 附上已核实参考候选。）

**示例 2 — 路径 B**（输入：3 图 + 1 视频 + 1 音频，宿舍情感短剧 3 个分镜）

> 整体设定为现代女生宿舍傍晚文戏，自然柔和光照。`<主体1> 的面部特征参考 @图片1（大头照），妆造参考 @图片2（全身照）`；`将 @图片3 中的简约木质宿舍 定义为 <场景1>`；运镜参考 @视频1 的中景推拉与轻微摇移；环境音色参考 @音频1。
>
> 镜头 1：中景平稳跟拍，<主体1> 脚步轻快地走到 <场景1> 门口，暖黄色日光从窗外洒进走廊，她在门口停顿一下，深呼吸，表情略带紧张，伴随轻微的脚步声与远处室内话语声。
>
> 镜头 2：镜头切到室内中景，<主体1> 推门进入，舍友们一边整理书本一边抬头看向她，其中一人笑着问 `{考得怎么样呀，过了吗}`，镜头在几人之间缓慢切换半身特写。
>
> 镜头 3：近景特写，<主体1> 先低头露出落寞表情，随后抬头憋不住笑意说 `{骗你们的}`，舍友们追着打闹起来，镜头缓慢拉远定格在宿舍内一片欢声笑语的全景。
>
> 全程画面高清电影纪实风，色调温暖，光影柔和；人物面部稳定不变形、五官清晰、动作连贯自然，不僵硬，无穿模无卡顿；保持无字幕，不要生成水印，不要生成 Logo；视频全程禁止出现外形、着装、配饰完全一致的人物，禁止生成同款分身、双胞胎效果。

#### 优化问题（**承担"透明披露"职责**）
针对原始提示词，列出：
1. **已补全的非关键缺失**（如：自动挂载了画质包；默认动作幅度采用低缓连续小动作；……）
2. **检出的病灶**（如：要素缺失、运镜冲突、Asset ID 裸写、任务类型误判、相互冲突或过载的时间码等）。

#### 相关原则
列举针对上述病灶所应用的 Seedance 2.0 工程化优化原则（如 `Asset ID 屏蔽原则`、`断句防歧义原则`、`一镜一运镜原则`、`镜头顺序优先于绝对时间`、`双胞胎兜底原则`、`重要素材前置原则` 等）。

## 音频通道

- **音频素材格式（强制）**：`@音频N` / `referenceAudios` / 音频分析接口只接受**真实音频文件 `mp3` / `wav`**。视频容器（`.mov` / `.mp4`，哪怕黑屏或波形占位）会被拒收：`Unsupported audio format: mov. Allowed formats: mp3, wav.`。素材若是视频/含视频轨，由上游按需加载 ffmpeg-win 抽音轨：`ffmpeg -y -i in.mov -vn -acodec libmp3lame -q:a 2 out.mp3`（或 `-vn out.wav`），再导入 `out.mp3` / `out.wav`。⚠️「黑屏 MP4」封装只用于 `understand_video`（视频理解），**绝不能**当音频素材上传。
- **音色参考**：`参考 @音频N 中的音色，生成…`；如音色还原度不佳，在提示词中补充细致音色描述（如 `使用 @音频1 低厚温润带细碎颗粒感中年男声的音色说`），并保持台词风格与参考音频语气接近。
- **台词语种统一**：避免中英文混用（专有名词除外）；小语种台词需标注语种，如 `用日语说道 {こんにちは}`。
- **中文发音兜底**：模型对多音字 / 生僻字 / 形近字易读错，可改写为发音一致的常用同音字（如"螭龙山" → "吃龙山"），并在"优化问题"段落披露替换。
- **片尾噪音建议**：含旁白的视频片尾可能出现截断杂音，建议后期通过剪映"音量包络线"做淡出处理（作为非强制建议给出）。

## 特殊字符规范（强制使用）

| 信息类型 | 符号 | 示例 |
|---|---|---|
| 背景音乐 | `（）` | `（背景中播放着快节奏的摇滚乐）` |
| 音效 | `<>` | `<远处传来狗叫声>` |
| 台词 | `{}` | `{你好，世界}`；小语种需标注语种 |
| 字幕 / 标题 | `【】` | `【第一章：启程】` |

## 文字生成三模板

模型直出文字只适合草稿或短而容错的装饰字。品牌名、价格、法律文案、长字幕、逐字台词等生产文字优先在后期用确定性字幕/图层叠加；若用户明确要求模型直出，生成后必须做内容 QA，逐字不符就改走后期排版，不能宣称模型可可靠复现精确文字。

- **广告语**：`「文字内容」+「出现时机」+「出现位置」+「出现方式」，「文字特征（颜色、风格）」`。
- **字幕**：`画面底部出现字幕，字幕内容为"…"，字幕需与音频节奏完全同步`。
- **气泡**：`<角色>说："…"，角色说话时周围出现气泡，气泡里写着台词`。

## 强制约束（总览）
- **复杂度优先于任务类型**：简单、单镜、轻量连续任务才走路径 A；复杂、多镜、混合媒介或需要展开导演/作品参考任一命中就走路径 B，明确多镜本身是充分条件。路径 A 允许跳过 `cinematic-prompt-format`，但只减少结构开销，不降低交付要求；两条路径最终都要覆盖 Step 4.0 的 12 项要素、八大核心要素与 Step 4.1 五大内容块（要素可增不可减，标题、分段与散文形式自由）。
- **五大必备内容块缺一不可**：演出核心+感情递进曲线（故事必须有起承转合）、收束方向权重块（默认 演出70/品质20/道具8/形象1/分镜<1，可按模式切换但不可省略）、品质绝对基准三条硬标准、详细高品质参考（神作画层+现代作品层+现代摄影层，逐项写采用手法）、监督演出思考=绝对支配者声明。详见 Step 4.1。
- **引用原样发送**：Skill 书写用 `@图片N` / `@视频N` / `@音频N` 与 `<主体N>@图片N`，这就是发给上游的形式——运行时不改写、不删 `@`；`@ImageN` / `<图片N>` / 裸 `图片N` 不会被替你改，重写时就要写成规范形式。
- **长图 / 九宫格先问用户**：检测到 grid / 长图 / 分镜板时用 `ask_user` 让用户在「拆成单图精确执行（推荐）」与「整张作氛围板低约束（带 2.1 前缀）」之间选择，不静默决定。
- **参考候选给用户选**：「导演与参考系」落笔前按 Step 3.3 主动出 2–3 个已核实真实影视参考候选（先复用知识库回执，未命中再检索），推荐首选；用户点名参考则直接核实采用。
- **关键歧义不静默修改**：仅当出现 3.1 中五类关键歧义时停下来等用户确认；普通要素缺失自动补全并透明披露。
- **强制兜底**：最终输出必须包含画质包 + 稳定包 + 水印 / Logo 兜底；按场景再挂载字幕兜底 / 双胞胎兜底 / 风格锚定。
- **Asset ID 屏蔽原则**：严禁让 `[asset-xxx]` 裸出现在动作描述中，必须通过 `@图片N` / `<主体N>` 桥接。
- **断句防歧义原则**：`@图片N` 后紧接动词或方位词时，必须改写为 `<主体N>@图片N` 或补名词隔断。
- **一镜一运镜**：单镜头只指定 1 种运镜方式，禁止推拉摇移叠加。
- **连续成段，不空行分块**：动作接动作、情节接情节、外貌 → 性格 → 心理 → 环境这些连着发生的描写不用换行或空行切开，用 `，` `；` `。` `——` `：` 衔接；小节名 / 内联标签后直接接正文，只在镜头之间（`镜头1：` / `镜头2：`）和语义块之间换行；中文字、标点前后不留空格。本 skill 里的示例排版是给人看的，不是提交格式。
- **镜头顺序默认优先**：默认使用 `镜头1 / 镜头2 / …`；用户明确要精确节拍时可用受支持的时间戳，但先检查总时长、动作负载和相邻段是否冲突。
- **复杂多人正面动态场景**：必须使用强方位约束 + 固定机位 + 双胞胎兜底，避免穿模 / 跳脸 / 同款分身。
- **身份锚点选择**：服从用户提供/指定；大头照+全身照、三视图/四视图/多视图板均可作为主锚。拿不准且身份关键时询问用户；未指定的低风险任务才默认大头照+全身照。

