# Short Video Script

> 生成抖音、TikTok、Reels等平台的短视频脚本，按照「3秒Hook → 冲突 → 反转 → CTA」黄金结构输出完整脚本，并附带逐镜分镜提示和精确时长控制。当用户直接说“帮我写一条抖音”、“策划一个短视频”、“写个带货视频文案”，或提及短视频脚本、视频文案、3秒hook、短视频分镜、口播脚本、带货脚本、种草视频、TikTok脚本等关键词时触发。

- Skill: `haomingz/short-video-script` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add haomingz/short-video-script`
- Raw SKILL.md: https://api.skillmd.com/api/skills/haomingz/short-video-script/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- License: MIT
- Author: haomingz (https://skillmd.com/u/haomingz)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/haomingz/short-video-script

---


# Douyin Video Script — 抖音/短视频脚本生成 SOP

按照「3秒Hook → 冲突 → 反转 → CTA」黄金结构，生成带分镜提示和精确时长控制的短视频脚本。适用于抖音、快手、小红书、视频号等短视频平台。

## Quick Start

1. 用户提供视频主题、目标时长、内容类型等基本信息
2. Agent 按下方 SOP 逐步生成脚本
3. 输出带分镜提示和时长标注的完整短视频脚本
4. 用户确认后，可导出为 Markdown 文件

---

## SOP 流程

### Phase 1：需求收集

**目标**：明确短视频的核心参数和风格定位。

**步骤**：

1. **收集基础信息**，向用户确认以下字段：

   | 字段 | 说明 | 示例 |
   |------|------|------|
   | 视频主题 | 本条视频的核心话题 | 职场沟通的3个雷区 |
   | 内容类型 | 口播/剧情/产品种草/知识分享/带货 | 口播+知识分享 |
   | 目标时长 | 视频总时长（秒） | 45秒 |
   | 目标平台 | 抖音/快手/小红书/视频号 | 抖音 |
   | 目标受众 | 核心观众画像 | 25-35岁职场新人 |
   | 风格基调 | 搞笑/干货/情感/悬疑/争议 | 干货+轻松 |
   | 出镜人设 | 出镜者的人设定位 | 资深HR姐姐 |
   | 产品/品牌 | 如涉及带货或种草，需要的商品信息 | 无 |

2. **如果用户只提供了主题**，其余字段按以下默认值处理，并告知用户：
   - 内容类型：口播
   - 目标时长：30秒
   - 目标平台：抖音
   - 风格基调：干货+轻松
   - 其余字段标注"待确认"

3. **确认核心卖点**：基于主题和类型，提炼 1 个核心信息点（用户看完视频必须记住的一件事）。

---

### Phase 2：脚本结构规划

**目标**：根据时长和类型，规划「3秒Hook → 冲突 → 反转 → CTA」的时间分配。

**时间分配模板**（适配不同时长）：

| 段落 | 占比 | 15秒示例 | 30秒示例 | 60秒示例 |
|------|------|----------|----------|----------|
| 3秒Hook | 10-20% | 2-3秒 | 3-4秒 | 4-5秒 |
| 冲突铺垫 | 25-35% | 4-5秒 | 8-10秒 | 18-20秒 |
| 反转/高潮 | 30-40% | 5-6秒 | 10-13秒 | 20-25秒 |
| CTA收尾 | 10-20% | 2-3秒 | 4-5秒 | 8-10秒 |

**规则**：
- 15秒以内视频：Hook+冲突可合并，一句话制造反差
- 15-30秒视频：标准四段式，每段紧凑
- 30-60秒视频：冲突可设 2 层递进，反转后可加延伸
- 60秒以上视频：允许多组"冲突-反转"，但每组不超过 20 秒
- 将时间规划表展示给用户确认后再进入下一步

---

### Phase 3：撰写3秒Hook

**目标**：在前3秒内抓住注意力，阻止用户划走。

**Hook 结构**：

```markdown
## 3秒Hook
**[00:00 - {结束秒数}]**

### 画面
> [分镜描述：镜头角度、人物动作、画面元素]

### 口播/字幕
> [Hook文案，必须在3秒内说完]

### 音效/BGM
> [推荐的音效或BGM节奏提示]
```

**7种高效Hook公式**（根据内容类型选择最合适的）：

| 公式 | 适用类型 | 示例 |
|------|----------|------|
| 痛点提问 | 知识分享/干货 | "为什么你的简历投了100份都没回音？" |
| 反常识断言 | 争议/干货 | "领导最讨厌的不是你能力差，而是……" |
| 数字冲击 | 知识/带货 | "90%的人洗脸都洗错了" |
| 场景代入 | 剧情/情感 | "当你加班到12点，发现同事早就走了……" |
| 视觉冲击 | 种草/测评 | [直接展示产品惊人效果的画面] |
| 悬疑钩子 | 剧情/干货 | "今天我要说一件，同事都不敢说的事" |
| 利益前置 | 带货/知识 | "学会这3句话，工资至少涨30%" |

**撰写规则**：
- Hook 必须在前 3 秒内完成（中文约 15-20 字以内的口播量）
- 不能用"大家好我是XXX"开头（这会让用户直接划走）
- Hook 要与目标受众的痛点/痒点/爽点直接相关
- 优先使用疑问句或祈使句，制造信息缺口
- 字幕必须同步显示 Hook 核心文案的关键词（大字+高对比色）

---

### Phase 4：撰写冲突与反转

**目标**：构建"冲突→反转"的叙事张力，让用户产生"原来如此"的满足感。

#### 4.1 冲突铺垫

```markdown
## 冲突
**[{开始秒数} - {结束秒数}]**

### 画面
> [分镜描述：人物表情、场景布置、道具使用]

### 口播/字幕
> [冲突文案]

### 节奏提示
> [语速、情绪、BGM 变化]
```

**5种冲突构建手法**：

| 手法 | 说明 | 示例 |
|------|------|------|
| 认知冲突 | 打破常见认知/做法 | "你以为早起就是自律？其实你在消耗意志力" |
| 痛点放大 | 把受众的痛点场景化、具象化 | "每次开会你想发言，话到嘴边又咽回去" |
| 对比冲突 | 展示理想 vs 现实的差距 | "别人的PPT vs 你的PPT" |
| 故事冲突 | 用情节推动紧张感 | "上周客户突然说要取消合同……" |
| 数据冲突 | 用数据制造认知落差 | "中国人均存款XX万，但80%的人其实……" |

**冲突撰写规则**：
- 冲突要具象化，避免抽象概念——说"场景"而非"道理"
- 冲突必须指向目标受众真实面临的困境
- 语速适当加快，制造紧迫感
- 口播句式短促有力，每句不超过 15 字
- 如涉及带货，冲突 = 使用前的痛点场景

#### 4.2 反转/高潮

```markdown
## 反转
**[{开始秒数} - {结束秒数}]**

### 画面
> [分镜描述：关键转折的画面呈现、特效提示]

### 口播/字幕
> [反转文案]

### 节奏提示
> [语速变化、停顿位置、BGM 切换点]
```

**4种反转手法**：

| 手法 | 说明 | 示例 |
|------|------|------|
| 方法论反转 | 给出出人意料但有效的解法 | "其实你只需要改一个动作——把'我觉得'换成'数据显示'" |
| 结果反转 | 展示意想不到的结果/效果 | [产品使用前后的对比效果] |
| 认知反转 | 揭示背后真正的逻辑/原因 | "不是你不够努力，是你努力的方向错了" |
| 情绪反转 | 从紧张/焦虑转向豁然开朗 | "后来我想通了一件事……" |

**反转撰写规则**：
- 反转前设置 0.5-1 秒的"微停顿"（标注在脚本中），制造期待感
- 反转的核心信息必须配大字字幕强调
- 反转内容必须与 Hook 中提出的问题/悬念形成呼应闭环
- 反转要给出"可执行的干货"或"可感知的效果"，而非空洞口号
- 如涉及带货，反转 = 产品带来的改变/效果展示

---

### Phase 5：撰写CTA收尾

**目标**：在视频结尾驱动用户行动（点赞、关注、评论、购买）。

**CTA 结构**：

```markdown
## CTA收尾
**[{开始秒数} - {结束秒数}]**

### 画面
> [分镜描述：结尾画面、引导动作（手势指向关注按钮等）]

### 口播/字幕
> [CTA文案]

### 屏幕元素
> [需要叠加的贴纸、箭头、文字引导等]
```

**CTA 公式库**（根据视频目标选择 1-2 个组合）：

| 目标 | CTA 公式 | 示例 |
|------|----------|------|
| 涨粉 | 价值预告+关注引导 | "关注我，下期教你另外3个面试加分项" |
| 互动 | 争议提问+评论引导 | "你觉得哪一条最有用？评论区告诉我" |
| 转发 | 利他暗示+转发引导 | "转给你那个总加班的朋友" |
| 收藏 | 实用暗示+收藏引导 | "建议先收藏，下次面试前翻出来看" |
| 带货 | 限时+稀缺+购买引导 | "链接放在购物车了，今天前100名半价" |
| 直播导流 | 福利预告+预约引导 | "今晚8点直播详细拆解，点预约不迷路" |

**CTA 撰写规则**：
- 每条视频选择 1 个主CTA + 最多 1 个副CTA
- CTA 必须给出明确的"行动指令"（关注/收藏/评论/点击），不要含糊
- CTA 要与视频内容自然衔接，不能突然跳到"求关注"
- 带货类视频的 CTA 需包含"紧迫感"元素（限时/限量/限价）
- CTA 口播长度不超过视频总时长的 15%

---

### Phase 6：分镜整合与视觉标注

**目标**：为整条视频生成完整的分镜脚本，便于拍摄和剪辑。

**逐镜分镜表模板**：

```markdown
## 完整分镜表

| 镜号 | 时间 | 段落 | 景别 | 画面内容 | 口播/字幕 | 音效/BGM | 备注 |
|------|------|------|------|----------|-----------|----------|------|
| 1 | 00:00-00:03 | Hook | 近景 | [画面描述] | [口播文案] | [音效提示] | [拍摄提示] |
| 2 | 00:03-00:08 | 冲突 | 中景 | [画面描述] | [口播文案] | [BGM提示] | [情绪提示] |
| ... | ... | ... | ... | ... | ... | ... | ... |
```

**景别参考**（简要说明，辅助非专业用户理解）：

| 景别 | 取景范围 | 适用场景 |
|------|----------|----------|
| 特写 | 面部/产品局部 | 强调表情、展示细节 |
| 近景 | 胸部以上 | 口播、情绪表达 |
| 中景 | 腰部以上 | 日常对话、动作展示 |
| 全景 | 全身+环境 | 场景交代、动作幅度大 |

**分镜标注规则**：
- 每个镜头标注景别（特写/近景/中景/全景）
- 标注镜头运动（固定/推/拉/摇/跟）——如果是手机拍摄，标注"固定"或"手持缓移"即可
- 口播文案标注语速（正常/加速/放慢）和情绪（平静/激动/悬疑/温暖）
- 需要字幕强调的关键词用 **加粗** 标注
- BGM 节奏转折点必须与"冲突→反转"的转折点对齐

---

### Phase 7：时长校验与组装

**目标**：确保脚本总时长精确匹配目标时长，并组装为完整脚本。

**时长计算规则**：
- 中文口播语速参考：正常 4-5 字/秒，快速 5-7 字/秒，慢速 3-4 字/秒
- 纯画面（无口播）：按实际需要的展示时间估算
- 字幕停留：关键信息字幕至少停留 2 秒
- 转场/停顿：每次转场预留 0.5-1 秒

**校验步骤**：
1. 逐段计算：按口播字数 ÷ 语速 = 预估时长
2. 加上纯画面时长和转场间隔
3. 总时长与目标时长对比，误差控制在 ±3 秒以内
4. 如超时：优先压缩冲突段（删减修饰词），其次缩短 CTA
5. 如不足：优先扩展反转段（增加案例/细节），其次增加冲突层次

**完整脚本输出模板**：

```markdown
# 短视频脚本：{视频主题}

| 项目 | 内容 |
|------|------|
| 视频主题 | {主题} |
| 内容类型 | {口播/剧情/种草/...} |
| 目标时长 | {N}秒 |
| 目标平台 | {抖音/快手/...} |
| 目标受众 | {受众描述} |
| 风格基调 | {风格} |
| 出镜人设 | {人设} |
| 核心信息点 | {用户看完必须记住的一件事} |

---

## 结构总览

| 段落 | 时间 | 字数 | 核心内容 |
|------|------|------|----------|
| 3秒Hook | 00:00-{T1} | {N}字 | {一句话概括} |
| 冲突 | {T1}-{T2} | {N}字 | {一句话概括} |
| 反转 | {T2}-{T3} | {N}字 | {一句话概括} |
| CTA | {T3}-{END} | {N}字 | {一句话概括} |
| **合计** | **{总时长}秒** | **{总字数}字** | |

---

## 完整脚本（含分镜）

（依次放入 Phase 3-5 的所有内容，保留时间和分镜标注）

---

## 完整分镜表

（放入 Phase 6 的分镜表）

---

## 拍摄备忘

- 拍摄设备建议：[手机/相机]
- 布光建议：[自然光/补光灯]
- 收音建议：[手机内录/领夹麦]
- 发布建议：[最佳发布时间段、话题标签建议]
```

---

### Phase 8：审校与交付

**自动校验清单**（逐项检查并报告）：

- [ ] Hook 在前 3 秒内完成，口播字数 ≤ 20 字
- [ ] 冲突段有明确的痛点/场景呈现
- [ ] 反转与 Hook 形成呼应闭环
- [ ] CTA 有明确的行动指令
- [ ] 分镜表镜号连续、时间无重叠
- [ ] 各段时间之和与目标时长误差 ≤ 3 秒
- [ ] 口播总字数与时长匹配（按语速计算）
- [ ] 每个镜头标注了景别
- [ ] 关键词字幕已用加粗标注
- [ ] 无硬广感（带货类除外）
- [ ] 语气风格与 Phase 1 设定一致

**交付流程**：

1. 展示完整脚本给用户确认，重点关注：
   - "Hook 能不能抓住你？"
   - "反转有没有'啊哈'感？"
   - "CTA 自然吗？"

2. 根据用户反馈修订，直到用户确认。

3. 导出选项：
   - 保存为 Markdown 文件
   - 如需其他格式，告知可使用对应 skill 转换

---

## 参数说明

本 skill 不需要外部参数或 API Key。以下为可选的定制项：

| 配置项 | 默认值 | 说明 |
|--------|--------|------|
| 语言 | 中文 | 脚本输出语言 |
| 视频时长 | 30秒 | 支持 10-180 秒 |
| 口播语速 | 正常（4-5字/秒） | 可选：快速/正常/慢速 |
| 分镜详细度 | 标准 | 标准（景别+画面描述）/ 详细（含运镜+灯光+收音） |
| CTA 强度 | 适中 | 轻/适中/强（带货类建议"强"） |

---

## 常见场景示例

### 场景 1：知识口播（30秒）
职场干货类，一个人对镜头讲述，3秒Hook提问 + 痛点冲突 + 方法论反转 + 关注CTA。

### 场景 2：产品种草（45秒）
美妆/日用品种草，Hook展示效果 + 使用前痛点 + 使用后反转对比 + 购物车CTA。

### 场景 3：剧情短视频（60秒）
情感/职场剧情，悬疑Hook + 矛盾升级 + 剧情反转 + 评论区互动CTA。

### 场景 4：带货视频（30秒）
直接卖货导向，利益Hook + 痛点放大 + 产品效果反转 + 限时购买CTA。

