# Storyboard Scene Breakdown

> 用于把爆款视频、参考图、截图或文字描述拆解成可复刻的 AI 视频/图像提示词。适用于“反推提示词”“复刻视频”“画面结构拆解”“逐帧拆解”“时间线”“空间关系”“镜头轨迹”“分镜分析”等场景。不输出标签词堆砌,而是输出时间切片、构图机位、主体动作、光影方向、环境纵深和镜头运动。

- Skill: `2799662352/storyboard-scene-breakdown` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add 2799662352/storyboard-scene-breakdown`
- Raw SKILL.md: https://api.skillmd.com/api/skills/2799662352/storyboard-scene-breakdown/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: 2799662352 (https://skillmd.com/u/2799662352)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/2799662352/storyboard-scene-breakdown

---


# Storyboard Scene Breakdown / 画面结构拆解法
<!-- skill-budget: standard -->

核心信念:复刻失败通常不是因为标签词不够多,而是因为提示词只写了“画面里有什么”,没有写清楚**动作怎么发生、镜头怎么走、物体在空间里怎么摆、光从哪里来**。不要把 AI 当“提示词反推器”,要把它当“视觉分析师 + 分镜画师”。

这个 skill 提炼自中文教程《告别低效反推:掌握“画面结构拆解法”》的核心方法。参考: <https://www.super-i.cn/info-2829.html>

## 先反对:不要交付标签词

当用户给一段视频/截图并说“反推提示词”时,不要直接输出一段“电影级、动态运镜、精致光影、赛博朋克、高清细节”的长描述。这类内容只是标签词,会导致三种失控:

- **动作缺乏时间线**:写“欢快跳舞”不等于说明 3 秒内怎么跳,模型会随机补动作。
- **镜头缺乏轨迹**:写“动态运镜”不等于说明镜头是环绕、推近、低角度上摇还是跟拍。
- **空间位置随机**:没写前景/中景/背景、主体相对位置、光源方向,模型会随机摆元素。

正确目标:把参考内容拆成**结构化导演说明**,再转成生成模型能执行的提示词。

## 第 0 步:先看清参考(视频别“看”,抽帧拼宫格图)

当输入是**视频/片段**(爆款参考片、上一段生成结果)时:`view_image` 不能直接开 MP4——**视觉结构**用 `ffmpeg-win` **等步长抽帧 → 拼成 3×3 / 4×4 宫格图(contact sheet)→ `view_image` 那一张宫格图通览**,读出镜头切点、运镜轨迹、首尾帧与空间关系;**剧情 / 台词 / 连续性**则用 `catimation-understand` 的 `understand_video` 看懂整段。两者结合再做下面的四维拆解,**只是别把 MP4 原始字节塞进聊天**。截图 / 单帧可直接 `view_image`。抽帧拼格先载入 `ffmpeg-win`;按剧情裁剪/拼接出的这张宫格图本身就是优质可复用素材。

## 画面结构四维

任何静态画面先拆这四维:

1. **构图与机位**
   - 景别:远景 / 全景 / 中景 / 近景 / 特写
   - 机位:平视 / 俯视 / 仰视 / 低角度 / 高角度 / 过肩 / POV
   - 主体位置:居中、三分线、边缘留白、遮挡关系

2. **主体特征**
   - 人物/物体的材质、姿态、表情、动作状态
   - 不只写“机器人/女孩/汽车”,要写可见细节:反光皮革、粗糙布料、湿发、屏幕面部、手部姿势

3. **光影与氛围**
   - 主光方向:左侧45度、背后轮廓光、顶部硬光、正面柔光
   - 辅助光/环境光:冷蓝补光、暖色反射、霓虹边缘
   - 色调:冷/暖、低饱和/高对比、烟雾/雨/尘埃

4. **环境纵深**
   - 前景:遮挡物、门框、树枝、玻璃反光、人物局部
   - 中景:主体动作发生处
   - 背景:建筑/人群/海面/火光/虚化程度
   - 景深:背景清晰还是浅景深虚化

## 视频必须加时间线

视频不是一张长提示词。不要用一段话概括 5-15 秒视频。按镜头切换和动作变化切成时间节点:

```text
0-2s: [景别/机位] + [主体动作] + [镜头运动] + [光影/空间]
2-4s: [下一动作变化] + [镜头轨迹变化] + [物理反馈]
4-5s: [收束动作] + [主体进入/离开画面] + [背景/氛围变化]
```

示例:

```text
0-2s: 特写镜头聚焦角色鞋底,鞋底与湿地面摩擦,水珠向后溅开,背景霓虹虚化。
2-4s: 镜头拉到中景并跟随角色转身,外套随动作向右摆动,左侧45度主光照亮侧脸。
4-5s: 镜头向前推,角色走向画面深处,身体逐渐融入背景蓝紫色光雾。
```

## 物理世界描述法

把抽象词换成物理信息:

- 不写“漂亮的光”,写“左侧45度主光打在面部,右侧有微弱蓝色环境补光”。
- 不写“他在走路”,写“步伐沉重,双臂自然摆动,镜头从后方平滑跟拍”。
- 不写“动态运镜”,写“镜头从泳池水面低角度向上推近,最后停在角色胸口高度”。
- 不写“尸体散落”,写“前景左下角一具尸体被裁切入画,中景脚边两具,背景沙滩上三具虚化”。

## 输出格式

当用户要“反推/复刻/拆解”时,优先输出这个结构:

```markdown
## 结构拆解

### 1. 画面骨架
- 景别/机位:
- 主体:
- 前景/中景/背景:
- 光源方向:
- 色调/氛围:

### 2. 时间线
- 0-2s:
- 2-4s:
- 4-6s:

### 3. 可替换元素
- 固定不变: [镜头轨迹、空间结构、动作节奏、光源方向]
- 可以替换: [角色、服装、道具、场景主题、风格]

### 4. 生成提示词
[把上面的结构合并成给目标模型使用的 prompt]

### 5. 需要手调/抽卡的风险
- [模型可能随机的部分]
- [需要参考图/首帧/角色图支撑的部分]
```

## 可替换元素原则

复刻不是复制标签,而是保留结构、替换内容。

- 保留:镜头轨迹、景别变化、动作节奏、空间层次、光源方向。
- 替换:角色身份、服装、道具、背景主题、材质风格。

例:如果原片是“机器人在泳池边跳舞”,不要只换成“猫在泳池边跳舞”。先保留结构:

```text
低角度水面前景 → 主体居中跳舞 → 镜头环绕半圈 → 左侧轮廓光 → 前景有遮挡物 → 背景海滨别墅虚化
```

然后再替换主体:

```text
低角度水面前景 → 穿防水雨衣的橘猫拟人角色居中跳舞 → 镜头环绕半圈 → 左侧轮廓光 → 前景漂浮泳圈遮挡 → 背景海滨别墅虚化
```

## 何时调用其他 skill

- 拆解之外的补强技法(人物动机、镜头序列节奏、物理量化、前中后景光学参数)→ Read references/related-techniques.md(相对本 skill 目录)。

## 出稿前检查

- 若参考是视频:视觉结构是否先用 `ffmpeg-win` 抽帧拼宫格图 + `view_image` 通览;需要懂剧情/台词时是否用 `understand_video`(而不是凭记忆)?
- 是否仍停留在“元素堆砌/标签词”?
- 是否写清每个时间段发生了什么动作?
- 镜头运动是否具体到方向、距离、角度或跟拍对象?
- 光源方向和空间层次是否明确?
- 主体、前景、中景、背景是否各自有位置?
- 可替换元素和必须保留的结构是否分开?
- 是否标明哪些地方需要参考图、首帧或手动抽卡?

