# Canvas Video Prompting

> 处理关键帧转视频、短视频规划、节奏控制与拆段判断；输出最小可执行的视频提示词结果，不把 SOP 固化进后端 prompt。

- Skill: `lyl1015/canvas-video-prompting` (Agent Skill)
- Install (CLI): `npx skillmds@latest add lyl1015/canvas-video-prompting`
- Raw SKILL.md: https://api.skillmd.com/api/skills/lyl1015/canvas-video-prompting/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: lyl1015 (https://skillmd.com/u/lyl1015)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/lyl1015/canvas-video-prompting

---


# JarvisHub Video Prompting

## 何时使用

- 用户要从关键帧、镜头图片或章节正文生成短视频
- 用户只要视频提示词，或要把视频节点落到画布
- 主代理需要判断是否应该拆段、是否需要节奏审查

## 输入证据

- 选中节点、关键帧、参考图、章节正文、连续性与素材工具结果
- 已验证的角色、环境、动作、对白、时长与禁止项
- 源剧本里的对白、旁白、OS/VO、字幕、环境音与音乐提示。只要原文已经给出这些声音信息，就视为执行事实，不得丢弃到“制作建议”里

## 执行原则

- 先确认事实，再组织 video prompt
- 是否先补关键帧、是否直接进视频、是否拆段，属于主代理基于证据的判断
- 长度、节奏、转场密度属于方法论，不属于后端硬编码
- 若需要专门提示词产出，可按需调用 `video_prompt_specialist`
- 若需要感知节奏审查，可按需调用 `pacing_reviewer`
- 若缺关键事实，显式说明缺口，不要用模板句硬填
- 若源剧本包含对白、旁白、OS/VO 或声音设计，最终 `prompt` 必须在对应时间段内原样或忠实改写保留这些内容；不得只在回答正文、制作建议、备注或 `storyBeatPlan` 中提到
- 视频模型真实执行只消费 `prompt`，因此所有会影响生成的画面、动作、对白、旁白、声音、唇动、情绪停顿与禁止项都必须折叠进 `prompt` 本体
- 若确实不能保留某句对白/旁白，必须显式说明原因；不得静默删除

## 输出契约

- 若输出视频提示词，最小结果应包含：
  - `prompt`
- 若需要保留拍点拆解，可附带 `storyBeatPlan`，但真实生成只消费 `prompt`
- 若输入包含对白、旁白或声音，`prompt` 必须按时间轴内联这些内容，推荐格式：
  - `0-5秒：画面、动作、镜头、情绪。`
  - `【声音】环境音 / 音乐 / 物理声。`
  - `【旁白｜说话者与语气】“原文旁白”。`
  - `【对白｜角色与语气】“原文对白”。`
- 可选结构化字段用于审阅与 UI 展示，但不能替代 `prompt`：
  - `storyBeatPlan`: 拍点拆解
  - `voiceoverPlan`: 旁白计划
  - `dialoguePlan`: 人物对白计划
  - `soundDesign`: 声音设计
- 若需要拆段建议，应明确指出拆分原因与建议边界
- 若证据不足，返回缺失事实，而不是伪造完整 prompt

## Seedance 时间轴提示词格式

当用户要求 Seedance 风格提示词、图生视频提示词、文生视频提示词或短片镜头图片视频 prompt 时，优先输出一条可直接复制执行的自然语言 `prompt`。格式应按时间推进，不要只列镜头标题。

推荐结构：

```text
整体风格、画质、角色一致性、镜头基调、负面约束。

0-5秒：具体画面、可见动作、镜头运动、情绪状态。
【声音】环境音、动作声、音乐进入方式。
【旁白｜说话者/声线/语气】“旁白原文。”

5-11秒：具体画面、人物动作、微表情、口型或呼吸变化。
【对白｜角色名/语气】“对白原文。”
【声音】物理声、环境声、音乐变化。

11-15秒：高潮/落点/尾帧画面，写清 Ending Frame 可承接的主体、构图、光线与情绪。
【旁白｜说话者/语气】“旁白原文。”
```

要求：

- 时间段总和必须匹配目标时长；用户未指定时，短视频默认可按 `15s` 组织
- 每个时间段都必须写可见画面，不允许只有情绪词或文学描述
- 对白/旁白要放在它发生的时间段下方，使用 `【对白｜...】` / `【旁白｜...】` 标记
- 需要口型时，在同一段补充“嘴巴只在说话时自然微动、低能量耳语、短暂停顿、唇部同步自然”等执行约束
- 声音不是后期建议；只要用户要求或原文已有声音，就必须写入 `【声音】`
- 黑屏字幕、片尾文字等不适合视频模型稳定生成的内容，应明确建议交给剪辑软件；若仍要保留，可写为 `【后期字幕建议】`，不要混入视频画面生成要求

示例：

```text
15秒日系复古胶片短片，真实摄影质感，清晨老屋自然逆光，丁达尔光束与空气微尘可见，浅景深，情绪克制、思念、温柔治愈。人物身份、服装、发型全程一致，无文字水印，无字幕漂移，无脸部变形。

0-5秒：清晨旧厨房逆光，铁锅蒸汽缓慢升起，丁达尔光束穿过旧木窗，镜头 slow push-in，画面安静克制。
【声音】水沸腾声、轻微环境底噪。
【旁白｜女声温柔低语】“妈，我今天又梦到你了。”

5-11秒：女孩坐在老房子木桌前，双手轻握黄铜老钢笔，低垂眼眸，肩膀随呼吸轻微起伏，镜头 eye-level half-body close-up。
【对白｜女孩轻声、像自言自语】“你说，人走了之后，是不是真的会变成风？”
【声音】钢笔轻触纸面、远处风铃极轻。

11-15秒：窗帘被微风轻轻吹起，桌面信纸自然翻页，女孩眼眸被暖光点亮，微微抬眼。
【对白｜女孩轻声、带试探】“……是你吗？”
【声音】风铃声更清晰，纸张摩擦声，极轻钢琴音进入。
```

