# Whiteboard Book Video Skill

> 白板火柴人拆书短视频工作流。用于把一本书或一段长内容做成 60-90 秒竖屏(9:16)白板手绘信息图风格的拆书口播短视频，并用 HyperFrames 在本地渲染无平台水印的最终成片。覆盖：拆书脚本与分镜表生成、白板火柴人信息图分镜图生成、口播配音生成(可选男声/女声)、背景音乐生成(可选活泼/沉稳/其他风格)、每个阶段与用户确认、HyperFrames 动效渲染+字幕卡点+音乐混音装配、成片交付。当用户提到"拆书视频""拆解一本书""白板风/火柴人信息图短视频""口播短视频""书评视频""把这本书做成视频"等需求时使用。

- Skill: `nutllwhy/whiteboard-book-video-skill` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add nutllwhy/whiteboard-book-video-skill`
- Raw SKILL.md: https://api.skillmd.com/api/skills/nutllwhy/whiteboard-book-video-skill/raw
- Safety review: pending (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: nutllwhy (https://skillmd.com/u/nutllwhy)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/nutllwhy/whiteboard-book-video-skill

---


# 白板火柴人拆书视频工作流

把一本书做成 60-90 秒竖屏白板手绘口播短视频。全流程分 6 个阶段，每个阶段产出后都要先向用户确认再进入下一阶段。**最终成片用 HyperFrames 本地渲染，不用云端视频生成模型**（本地渲染环节无平台水印，不消耗云端视频生成额度）。

## 总流程（每阶段产出 → 用户确认 → 下一步）

0. **选节奏模式（开跑前先问）**：问用户要「慢版」还是「高密版」（见下方"节奏模式"）。两种模式各有对应脚本/图片/渲染参数，用户也可自定义画面数。
1. **调研与脚本**：读懂书的核心内容 → 产出「调研报告 + 拍摄脚本」（含按所选模式生成的分镜表 + 口播逐字稿 + 每镜头生图提示词）。→ 用户确认脚本
2. **分镜图**：按白板火柴人信息图规范，根据所选节奏模式生成对应数量的竖屏图。→ 用户确认风格/图（含人设或火柴人讲师选择）
3. **口播配音**：按脚本逐字稿生成配音，先问用户要男声还是女声。→ 用户试听确认
4. **背景音乐**：生成 BGM，先问用户要活泼还是沉稳（或其他风格）。→ 用户确认
5. **渲染装配**：HyperFrames 逐步画出动效 + 词级字幕卡点 + BGM 侧链混音 → 无水印成片。
6. **交付**：拷贝到项目根目录，`present_files` 交付，留系列化建议。

## 节奏模式（用户在开跑前二选一，可自定义）

| 模式 | 画面数 | 每画面时长 | 口播字数 | 适合 |
|---|---|---|---|---|
| **慢版** | 约 6-8 画面 | 6-9s | 约 320-380 字 | 讲书逻辑/深度解读，节奏从容 |
| **高密版** | 约 16-20 画面 | 4-5s | 约 280-340 字 | 信息密度高、快节奏、防单调，适合短视频完播 |

- 两种模式都用同一套白板信息图风格与"逐步画出"动效，差异只在画面切分粒度与口播断句。
- 用户未表态时默认问一次；用户自定义画面数时按其要求生成。
- 渲染阶段：慢版直接每画面一镜；高密版可把相邻画面合并成"多小节一镜"（每镜内依次 reveal），减少渲染镜头数，具体见 `references/render-and-assemble.md`。

## 关键默认（可被用户覆盖）

- 画幅：竖屏 9:16，1080×1920；单张分镜图 1152×2048（9:16）。
- 时长：60-90 秒；镜头硬切 + 每镜"逐步画出"揭示动效（约 1.9s）。
- 配音时长 = 视频总时长（视频按配音长度铺）。
- 字幕：词级卡点（用 faster-whisper ASR 词级时间戳），白板便签风样式（白底黑边圆角、黑字、红高亮），高密版字幕更多更短、慢版字幕更少更长。
- 画面角色：默认角落简笔画火柴人讲师；若用户提供个人 IP 形象（AI 生成卡通头像），先征询是沿用 IP 当主角还是用火柴人。

## 阶段细则（按需读取 references）

| 阶段 | 读哪个 reference | 要点 |
|---|---|---|
| 脚本 | `references/script-writing.md` | 钩子→痛点→核心观点→案例→行动→收尾；7 镜头分镜表+逐字稿 |
| 分镜图 | `references/image-prompt.md` | 白板/网格底、马克笔线条、红蓝黑三色、角落火柴人、30%+ 留白、单图高密度 |
| 配音 | `references/audio-voice.md` | seed-audio T2A；男/女声模板；下载核验真实时长；ASR 词级字幕 |
| 音乐 | `references/audio-music.md` | 活泼/沉稳/其他风格模板；ffmpeg 循环拼接；侧链 ducking 混音命令 |
| 渲染装配 | `references/render-and-assemble.md` | HyperFrames lint/check/render、逐步画出动效、抽帧验证、混音交付 |

## 必须遵守的纪律

- 每个阶段结束**必须停下来等用户确认**，不擅自连续跑完。
- 配音和 BGM 的音色/风格是用户点名的选择项，必须先问再生成。
- 生成图片若要做系列延展（保持白板背景/字体/配色一致），用 `image_edit` 并传已确认的核心图 URL，不靠文字重画。
- 涉及书的价格、评分、销量、豆瓣数据等外部事实，必须来自检索结果并标注来源，不编造。
- 成片交付前必须抽帧验证真实渲染画面（逐步画出、字幕位置、无重叠），不只看静态预览。

