# Story To Realistic Video Prompt

> 把一句话点子或一小段剧情扩写成中文真人电影感视频生成提示词（IMAX质感），默认15秒/2500字左右。五段结构输出，带时间段标注。适用于 Sora/Veo/可灵/即梦/Runway 等文生视频。

- Skill: `gaojesse999/story-to-realistic-video-prompt` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add gaojesse999/story-to-realistic-video-prompt`
- Raw SKILL.md: https://api.skillmd.com/api/skills/gaojesse999/story-to-realistic-video-prompt/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: gaojesse999 (https://skillmd.com/u/gaojesse999)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/gaojesse999/story-to-realistic-video-prompt

---


# 剧情转真人电影感视频提示词

## 核心目标

输入：一句话点子或一小段剧情。输出：一条可直接投喂视频模型的中文提示词，IMAX真人实拍质感。默认15秒，**2500中文字符左右**（2300-2700区间）。只输出提示词正文，不解释不写大纲。每个时间结点（`【Xs-Ys】`）必须按**分镜时间评估**（见下文）由每个节拍的真实时长估算得出，而非把15秒平均切分。生成后保存为工作区根目录 `场景名-YYYYMMDD-HHMMSS.md`。保存后用本skill目录下的 `scripts/count_chars.py` 验证字数是否达标，不达标则调整后重新保存。若评估总时长超过15秒，必须在提示词正文之后追加**时长告警**块（见输出文件结构）。

## 写作前静默提取（不向用户复述）

主体/地点/事件节拍/情绪/场景类型/全局约束/素材引用。缺主体或缺地点且无法推断时才提问。若工作区存在 `assets/整体风格.md`、`assets/人物圣经.md`、`assets/场景圣经.md` 则默认读取，不写进正文。优先级：用户要求 > 素材引用 > 圣经文件 > 本skill默认。

## 素材引用规则

- 提示词以素材引用行开头，格式固定为 `[素材显示名] =素材标识`，同一行用中文逗号分隔，固定顺序：主场景→人物→怪物→道具/语音。素材引用结束后必须换行，再进入下一段正文。
- 默认可用素材引用格式：`[邪恶洞窟] =洞窟， [野蛮人] = 野蛮人， [女巫] = 女巫， [亚马逊] = 亚马逊， [沉沦魔萨满] =沉沦魔萨满， [沉沦魔] =沉沦魔， [亚马逊语音] =亚马逊语音， [女巫语音] =女巫语音， [沉沦魔萨满语音] =沉沦魔萨满语音`
- **有素材引用的主体/场景**：正文中不描述外貌/服装/发型/建筑/空间结构，也不写"参考素材"等声明性废话。但**必须写手中武器/道具**（如"野蛮人双手各握一把手斧""女巫右手持法杖"），这是后续动作逻辑的前提。
- **有素材引用场景**：只写本镜头的光线/天气/氛围动态，不复述空间结构。
- **未素材引用的主体**：给3-5个外观锚点（出场即定义）。
- **同一素材引用形态的多个个体**（如4只沉沦魔）：只写个体间差异点（伤疤/体型/武器变体等）。
- 生成前静默核对素材引用中的手部占用、道具状态、服装约束、空间结构，确保动作不冲突。冲突时优先改写动作适配素材。
- **声音资产引用**：
  - **只引用"说话角色"的声音**——本条提示词中有台词或出声（呼喊/惨叫/吟唱等）的角色，才在素材引用行末尾（道具之后）追加其声音资产，格式同其它素材：`[角色语音] =角色语音`。
  - **背景声、环境音、打斗/法术等音效不是资产，一律不引用**，按「音频规则」写成普通文字。
  - **镜头外（画面看不到）但有声音的角色也必须引用其声音资产**——如画外呼喊、幕后说话者、远处嘶吼，只要音轨里能听到该角色的声音，就要在素材引用行声明其声音资产。
  - 声音资产**只出现在素材引用行**；正文对白处直接写台词内容，不再重复标注语音引用。无说话角色时，不写任何声音资产。

## 音频规则

不写"语音参考""音色参考"等声明性废话——说话角色（含镜头外出声角色）的声音通过素材引用行的**声音资产**声明（见素材引用规则的「声音资产引用」），正文对白只写台词内容。提示词中只写：无字幕、无背景音乐 + 列举本场景具体音效。**环境音、背景声、打斗/法术音效写成普通文字，不作资产引用**；对白直接写台词内容。

## 五段输出结构

段间空行分隔，不加标题/编号：

1. **素材引用行+约束**：第一行写素材引用，如 `[邪恶洞窟] =洞窟， [野蛮人] = 野蛮人， [女巫] = 女巫， [亚马逊] = 亚马逊， [沉沦魔萨满] =沉沦魔萨满， [沉沦魔] =沉沦魔， [亚马逊语音] =亚马逊语音， [女巫语音] =女巫语音， [沉沦魔萨满语音] =沉沦魔萨满语音`；素材引用结束后换行，下一行写【用户约束】或直接进入全局规格。
2. **全局规格+音频**：画质+渲染+排除项+具体音效列举（1-2句）
3. **基调情绪+场景环境**：情绪一句 + 光线/天气/氛围动态（合为一段）
4. **主体锚点**：每个角色的位置/朝向/手中武器/动态状态。多个体只写差异点。
5. **运镜+动作时间线+收尾**：运镜总纲1-2句（交代起始机位、整体运动方式、景别走向），随后按 `【Xs-Ys】` 时间段推进（15秒分3-5段），每段内必须写明**景别+运镜+动作+物理反馈+微表情**同句绑定。**每段的起止秒数不是平均切分，而是按「分镜时间评估」对该段核心节拍估算出的真实时长累加得出**（详见下文）。

**景别要求**：每个时间段必须明确标注当前景别，从以下选取：
- **远景/大全景**：交代环境全貌、人物与空间关系
- **全景**：人物全身可见，展示身体动作与站位
- **中景**：膝盖以上，展示肢体动作与互动关系
- **中近景**：胸部以上，兼顾表情与上肢动作
- **近景/特写**：面部或局部细节（表情、手部、武器、伤口反应等）

景别转换要有逻辑：远→近为揭示/聚焦，近→远为释放/全局交代。同一时间段内景别只写一个主景别（可含"推至""拉至"的动态变化）。

**时间段格式**：`【0s-3s】中景，……【3s-7s】中近景推至近景，……【7s-12s】……【12s-15s】全景，……`，段间自然连贯不换行。每段秒数由「分镜时间评估」累加得出，相邻段首尾相接、不留空隙、不重叠。

## 分镜时间评估（移植自 shotlist-builder）

核心思路：**镜头时长不能凭感觉平均切分，而要由每个节拍「实际发生的内容」推算出固有时长**。先逐节拍估时，再累加，最后对照15秒预算判断是否超时。

### 节拍时长基准表

按节拍类型给出真实银幕时长（中文台词按 **4-5 字/秒** + 自然停顿换算）：

| 节拍类型 | 估计时长 |
|---|---|
| 硬切闪现 / 瞬间空间定位（split-second 大全景/远景） | 0.3–0.5秒 |
| 插入 / 特写定格（道具、武器、伤口、表情瞬间） | 0.3–2秒 |
| 单个简单动作（一次挥击、一个转身、迈一步、抬手） | 1–2秒 |
| 一次完整攻击链（蓄力→命中→余波/受击反馈） | 2–4秒 |
| 一句台词（中长，含起话与收尾停顿） | 3–7秒 |
| 无台词反应镜头（带完整情绪弧） | 5–10秒 |
| 情绪特写完整弧（5–7个编号微表情节拍） | 8–15秒 |

### 估时方法（生成时静默执行）

1. **拆节拍**：把场景拆成离散节拍——一个核心动作、一句台词、一次反应、一个插入，各算一个节拍（呼应铁律「一个时间段一个核心动作」）。
2. **逐拍估时**：每个节拍对照基准表取一个时长。台词按字数折算（数清字数 ÷ 4–5 字/秒，再加 0.5–1 秒收尾停顿）；动作按复杂度（单动作取下限，攻击链取中段）；情绪弧按编号微表情节拍数（每个微表情节拍约 1–1.5 秒）。
3. **累加定结点**：从 0 开始顺序累加，得到每段的 `【Xs-Ys】` 真实起止秒数。**结点是算出来的，不是凑出来的。**
4. **对照预算**：
   - 累计 ≤15 秒：正常输出，时间结点止于 `【…-15s】` 或更早。
   - 累计 >15 秒：**优先压缩**——删次要节拍、合并同类动作、把过长的情绪弧缩短微表情节拍数、把独立插入并进相邻段；能压回 15 秒内最好。
   - 压缩后仍 >15 秒（内容确实装不下）：**保留真实结点**（末段可写到 `【15s-Xs】`），并在正文后追加「时长告警」块，说明超时原因。

### 取舍优先级（压缩时）

删减顺序：装饰性插入 > 重复的余波镜头 > 多余的反应停顿 > 次要角色的并行动作。**绝不删**：核心动作的命中帧、因果关键节拍、收尾全景。宁可少节拍、短弧，也不要把一条提示词塞爆——多出来的内容应建议拆成下一条提示词。

## 铁律

1. **一个时间段一个核心动作**，动作多就拆时间段。
2. **运镜与动作同句绑定**：每个时间段内镜头行为与角色动作写在一起。
3. **出场即定义**：角色首次出现写清位置+手中武器+动态状态。
4. **删元指令**：不写"强化氛围""务必""拉满"等不可成像的废话。
5. **去重复形容词**：同义词只留一个最准的。
6. **只写视觉可见/听觉可闻**：一切描述必须能在画面上看到或在音轨中听到。气味/味觉/内心独白等不可成像信息，必须转化为角色的可见反应（表情、肢体、动作）。例：不写"烤鸡很香"，写"角色仰头闭眼深吸一口气，喉结上下滑动"。

## 多人打斗规则

- **每个时间段只聚焦一组对决**：如A对D和E，则画面只有A、D、E。不同时间段可切换聚焦。
- **一对多时非交战对手不能傻站**：必须有并行动作（爬起/绕侧翼/蓄力/冲来），为下个节拍铺垫威胁。
- **打斗结束必给收尾全景**：最后时间段后拉/俯拍，同时展示所有参战者最终状态（胜方站姿+败方倒地+战场痕迹）。

## 暴力尺度

保持动作电影级暴力感，**禁止**：断肢、大量鲜血喷涌、内脏外露、详细出血描写。**替代手段**：力量反馈（击退/击飞）、声音暗示（闷响/钝响）、姿态暗示（瘫倒/痉挛/武器脱手）、环境碎片（泥水/碎石/尘土）、镜头回避（切到表情/武器特写）。

## 场景类型→节奏路由

- **动作类**：蓄势慢→命中快→余波慢，每时间段聚焦一个攻击主体。
- **叙事类**：跟拍/并行/缓推，靠雨雾火风承载氛围。
- **对话类**：过肩+反应特写表现权力转移。
- **混合类**：类型切换要有可见过渡。

## 连续性自检（静默执行）

- 空间：谁在正/背/高/低/远，攻击路径与视线方向合理。
- 物理：抛出物体会落下，受击有反馈，无瞬移无凭空新姿态。
- 因果：高潮由前面动作推动，不突兀出现。
- 群像多个体：素材引用同形态则只写差异点；未素材引用则体型/装备/伤痕要有辨识度。
- 时长：逐节拍估时累加，结点首尾相接无空隙；累计 >15 秒时已尝试压缩，仍超则末段保留真实秒数并触发「时长告警」块。
- 声音资产：正文里每个有台词/出声的角色（含镜头外出声角色）都在素材引用行声明了声音资产，且无缺漏；非说话角色、环境音、音效均未被错误地引用为声音资产。

## 密度控制

字数预算花在：动作物理因果、运镜、微表情、动作触发的环境反馈。不花在：素材形象复述、声明废话、重复形容词。每句必须新增可见信息。

## 负面约束

禁止：动漫/卡通感、塑料/AI感、无身体表现的抽象情绪、同时间段矛盾的光线或镜头方向、过多无名新增角色、不可成像的元指令。

## 输出文件结构

仅当评估总时长 **>15秒** 时，在「提示词」正文之后、「角色位置时间线」之前插入「时长告警」块；≤15秒时整块省略。

```
# 提示词

（五段结构正文，2500字左右）

---

# ⚠️ 时长告警

预计总时长 **约 X 秒**，超出 15 秒上限约 Y 秒。

逐段估时：
- 【As-Bs】<节拍简述>：约 N1 秒（<超时贡献点，如台词约18字≈4秒、攻击链含蓄力+命中+余波≈4秒>）
- 【Bs-Cs】<节拍简述>：约 N2 秒（……）
- …

主要超时来源：<点名是哪一/几段、各占多少秒导致累计超15s>。
压缩建议：<具体建议，如删去某装饰插入省X秒 / 把末段反应弧移到下一条提示词>。

---

# 角色位置时间线

| 时间点 | 角色A | 角色B | 角色C | 敌人 |
|--------|-------|-------|-------|------|
| 开场（0s）| 位置，朝向 | 位置，朝向 | 位置，朝向 | 位置 |
| 事件1（~Xs）| 动态 | 动态 | 动态 | 动态 |
| 结尾（~15s）| 最终状态 | 最终状态 | 最终状态 | 最终状态 |

位置用相对空间关系描述（"路中央""身后半步""左前方3米"），朝向写清楚，未移动写"原地"。
```

