# Visual Multimedia

> 把已确认的内容真源或素材制作成可修改、可预览、可导出的技术图解、GIF、HTML 动画、Live Photo、产品功能宣传片、其它视频、音频或播客，并审查或写作标题、口播、字幕、节目结构和配套帖子。Use when the user asks to 选择载体、审查或制作媒体文案、诊断口播 AI 组织痕迹、维护口播私人库、制作可编辑网页视觉与多场景演示、导出技术图解/GIF/Live Photo、制作或对齐视频、剪辑实拍/访谈/录屏、从视频与事实转写制作字幕金句拼图、建立或使用无需 Live2D 的二次元口播角色、编辑音频或播客；不用于其它独立静态卡、社交卡、纯文字卡、轮播图或独立封面，也不用于 PPTX、研究或核查主题、从长材料筛选分享内容、独立纯文字内容、长文、拍摄规划、社媒运营或发布。

- Skill: `cheshiremew/visual-multimedia` (Agent Skill, multi-file: 14 files)
- Install (CLI): `npx skillmds@latest add cheshiremew/visual-multimedia`
- Raw SKILL.md: https://api.skillmd.com/api/skills/cheshiremew/visual-multimedia/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Web & Frontend
- Author: CheshireMew (https://skillmd.com/u/cheshiremew)
- Updated: 2026-09-22
- Page: https://skillmd.com/skills/cheshiremew/visual-multimedia

---


# Visual Multimedia

## 目标与边界

把成立内容转化为合适的媒体表达，并保留可修改的制作真源。Agent 负责载体判断、媒体文案、样稿、制作、修改、导出和真实结果检查；具体观点、事实、经历和来源仍由用户输入或上游内容真源决定。

适用于：

- 从确认内容中选择载体，起草或修改标题、画面文字、口播、字幕、节目结构和媒体配套帖子，并按需维护口播声音、案例和钩子库。
- 把技术图解、B-roll、动态图解、GIF 和多场景动画做成可编辑网页，再以手动、自动或混合播放派生所需媒体。
- 剪辑讲课、访谈、实拍、录屏、音频或播客，并从已有视频派生字幕金句拼图。
- 按明确参考复刻或对齐视频；建立或采用二次元口播角色；制作采访原声讲解型视频或有真实证据的 GitHub 项目介绍视频。

不适用于独立静态卡、社交卡、纯文字卡、轮播图或独立封面，也不适用于研究核查、独立文章、拍摄规划、PPTX/Keynote、账号运营与发布。仅支持从视频及事实转写派生字幕拼图，不扩展为其它静态设计；其它独立静态请求停止，不改做视频。

用户只点名本 Skill、未说明成品时，只在仍支持的载体中给出首选及理由；没有合适载体就在媒体文案后停止，不为避开静态卡强加运动。用户明确要受支持成品时直接进入对应功能区，不比较载体。

## 任务工作区与交付位置

所有生成任务先估算峰值字节，用 `node scripts/media-task-workspace.mjs preflight --task-id <稳定任务-id> --expected-bytes <字节>` 通过容量闸门，再以同一参数执行 `ensure`。制作真源、中间文件、预览、报告、渲染和成品都留在本 Skill 的 `artifacts/<task-id>/`；大型派生缓存只能进入本机已配置且有上限的缓存根。本文的“项目目录”均指该目录或其子目录。当前终端目录、活动 Git 仓库、输入项目和外部交付位置都不是生产目录。结束时运行 `inventory` 和 `finalize --status completed|failed|interrupted`；没有删除授权只报告清理候选。

用户点名外部交付目录时，仍先在 Skill 内制作和检查，只复制最终文件；Skill 内真源、报告和成品继续保留，外部副本不成为修改入口。外部产品服从自身配置，但可移交真源、快照或交付结果必须收回任务目录。未点名外部交付时，不向其它项目写生成文件。

## 当前视频默认基线

中文视频最终默认显示中文主字幕，下方为英文小字幕，两层共用真实声音边界。原创中文视频先交完整中文字幕，确认后再做英文、声音、方向和样片；中文变化使下游失效。合成旁白默认使用注册声音 `game.honkai-star-rail.silverwolf.default`，由 GPT-SoVITS `speech.synthesize` 以 `speed_factor: 1.25` 生成。中文句子中的英文、缩写和英文专名保留正式拼写，与中文整句混合合成；实际试听确认读音异常后，才在项目发音表中改用中文谐音并重新整句合成。字幕和屏幕文字仍用正式写法，不默认拆分中英文音频。用户指定其它读法或声音时覆盖这一基线。真人原声或现成旁白先确认复核转写整理出的主字幕，再按真实声音定时。

## 入口判断与内部边界

先确定成品、确认内容、受众、已授权素材和规格，再选路径。没有明确点名或授权时，不搜索、不枚举、不打开、不预览这些视觉文件。各功能区只接收所需内容、已授权素材和确认结果：

- 用户已经指定独立静态卡、社交卡、纯文字卡、轮播图或独立封面时，按目标边界停止，不创建 HTML、画布或图片，也不把请求升级成结构化网页。
- 用户没有指定载体或确实需要跨媒体组合时，才读取 `references/content-to-media.md`。
- 可编辑网页视觉统一使用 editable-media v6；多场景、动画、结构化编辑、多比例统一管理、MediaFlow Pro、HyperFrames、复杂媒体管线或跨项目网页组件仍按各自需要启用。
- 视频、音频、播客和二次元角色只在用户要求对应成品时进入自己的 reference。退出范围内的静态请求不会启动这些功能。
- 运行时和导出检查服从已选路径，不反过来扩大成品范围或重新决定内容、尺寸和视觉方向。

建立二次元口播角色时读取 `references/anime-avatar-production.md`。只有母版时，先提供 `assets/anime-avatar-prompts/motion-source-video.md` 的完整提示词和合格条件；完整制作且外部生成已获授权时直接提交。已有校准视频时由 Agent 检查画面，并完成裁切、联系表、口型标注、机器文件和验证；不要求用户逐帧整理素材、编辑 JSON、运行内部命令或确认技术计划。

无骨骼路径使用校准视频的完整人物帧，适合克制动作和普通话口型大体同步。明显动作与高精度口型不能稳定兼得时，在生成前停止并让用户选择音频驱动或分层、骨骼系统。角色建库不套长视频五阶段；`confirm-plan` 只确认 Agent 已检查技术计划。

默认模式下，用户已经说清时直接执行；缺失信息只影响局部时从现有内容采用保守且可逆的选择。缺口会改变大部分文案、载体、构图或剪辑时，先读取材料和项目规则，仍无法确定再询问一个关键问题。生产位置不属于待猜测输入，始终由本 Skill 的任务工作区确定。

当前请求处于 Plan 模式时，无论上述信息是否已经完整，都先读取 `references/plan-mode-creative-interview.md`；本 Skill 不自动开启或关闭 Plan 模式。

内容真源不完整时，只补齐媒体表达所需的结构，不自行发明事实、第一人称经历、来源或作者立场。需要外部研究或事实核查时，先说明缺口并取得对应授权；未获得授权时停在现有材料能够支持的范围。

网页视觉、图解或视频包装的输入是研究材料、长稿或尚未确认的草稿时，由当前媒体文案路径直接整理成观众可见文字；完整视频内容读取 `references/voiceover-writing.md`，轻量画面文字读取 `references/media-writing.md`。只有用户明确点名 `clean-copy` 时才交给它处理已有文字。已经确认最终上图文字时不再改写，视觉制作只读取确认后的观众可见文字。

个人或系列内容带有上游确认的 `editorial_position` 与 `voice_contract` 时分别读取：前者决定媒体文案强调什么、如何评价和说到哪里，后者决定视角、推进、句子节奏、幽默和结尾。两者缺失时沿当前内容真源与用户已确认文案制作，不从视觉参考、制作配方或平台模板推导作者观点和口吻。

同一来源准备派生多个成品，或者当前任务属于连续系列时，读取上游提供的来源标识、来源版本和内容单元标识。每个媒体项目保留这组来源信息，并另外记录项目标识、当前媒体文案版本和实际导出物；来源版本发生变化时，先核对受影响项目使用的主张、素材与文案，再继续导出。

## 默认正向流程

### 1. 选择具体载体

根据内容怎样成立和现有素材选择一个首选载体：

- 技术机制、接口、系统关系、流程或比较确实需要空间关系才能看懂时，优先技术图解；只靠一段文字或清单就能成立、又没有合适时间型载体时，完成媒体文案后停止。
- 状态变化、数值变化、循环、反馈、局部演示或需要原位逐步显现的关系，优先 GIF 或动态图解。
- 由代码画面承担的多场景推进、逐步揭示或现场讲解，优先网页动画；需要演讲者决定何时推进时使用手动播放，需要连续观看或导出时使用自动播放，需要页内自动运动但在章节边界等待时使用混合播放。
- 人物表达、故事、访谈、讲课、实拍、录屏，或多场景价值主要来自连续声音和镜头时，优先视频。
- 主要价值来自讲述、对谈、访谈、声音氛围或适合伴随收听的连续内容，优先音频或播客。

同一内容适合多个载体时，结合目标受众、已有素材、平台规格、制作成本和信息损失给出一个首选。只有备选能够提供不同的真实价值时才补充。

### 2. 先完成并筛选媒体文案

制作前先固定标题、节目结构、主字幕和事实边界。原创带语音视频的第一份用户可见成果必须是完整主语言字幕内容，不是提纲、英文、配音、方向或样片；确认后再派生其它内容。

技术图解、网页视觉和视频包装只接收已经确认的最终上图文字；内容尚未确认时先完成上一节的清理与确认，不在视觉功能区再建一套筛选规则。

主字幕按观众理解顺序写，用普通话说明对象、用途、观看价值和事实结果。内部字段与维护术语不进入字幕；必要术语先解释观众能复述的关系。确认后再分配旁白与画面职责。

先选写作动作：只审查就诊断后停止；新写、扩写、重组或改写完整内容时，先确定观众和观看价值，再从确认材料、声音证据及用户指定或适用的完整参考直接写主语言字幕。制作顺序、内部合同和验收不自动成为观众内容。确认后才派生朗读文本。AI 句式是上层问题症状，不建禁词表；术语取舍由观众理解需要决定。错字、格式、等义压缩、短标题、数据标签和简短字幕走轻量路径。

每轮修改综合原始请求、活动真源、有效确认和最新反馈。“在当前基础上优化”保留真源、已确认内容和未被否定的约束。用户指出丑、字小、太密或空白过多时，先定位为内容重排、局部换装或整体改版，只让受影响层失效。“太丑”本身不等于整体改版；沿当前基础优化时不得换模板或从空白重建。内容或比例变化后重新计算整张画布。

媒体文案默认由当前模型起草，点名其它生产者时才切换；都使用同一净化材料、声音和参考，并完成同一回读。逐字引用、数据标签、来源和确认内容保持原样。

个人或系列媒体文案先按 `editorial_position` 选信息与评价方向，再从明确指令、声音样稿、口播真源和同语境合格候选生成 `voice_contract`。缺少个人声音证据时保持普通直接，不从案例、钩子或 AI 草稿推导。时长与密度由成品职责决定。

已确认最终上图文字时不再改写；只有材料或长稿时由当前媒体文案路径形成并确认上图文字。技术图解、网页视觉和视频包装按阅读目的选择文字、表格、图形、图片或组合；图形仅在更易理解或用户明确要求时使用。只要求文案时交付后停止。

### 3. 建立语义片段和时间结构

时间型媒体先把已确认的主语言字幕稿拆成连续语义片段，记录新增信息、声音范围、画面职责、进入退出和真实时长来源。用户未点名 B-roll 也要逐段判断：能增加证据、场景、动作、情绪、结果或剪切连贯性才采用，否则保持现有画面，不逐句切换。代码生成网页把片段变成场景和步骤；实拍或录屏剪辑只从已明确提供或授权的素材选取、定格和切点，不建网页场景。生成、采用或录制声音后，以实际音频更新时间边界，但不反向改写已经确认的字幕含义。制作备注、暂停提示、调试信息和审阅标签不进入观众可见字段。

代码生成网页的运动按当前含义选择：持续现象使用片段内循环；方向性变化完成一次演进后保持结果；反馈关系使用保留累积状态的局部循环；比较保持可同时读取；概念切换承接前后对象；结论允许稳定停留。需要延长网页画面时，只延长当前片段的运动或状态。已有素材怎样补足时长只由视频后期路径决定。

无实拍视频、代码动画或动态图解由运动本身承担主要表达时，在实现前再确定贯穿当前段落或相邻场景的运动载体、它的开始和结束状态、真正改变含义的动作、前后承接锚点以及文字只负责什么。承担推进、因果、转折或兑现的片段必须让状态变化直接可见；结论、证据阅读和刻意停顿可以稳定保持。不能用标题、卡片或截图轮流淡入代替本应由对象关系和状态变化表达的内容。

代码动画的每个步骤都写明开始、变化、结果或保持状态及其实际含义。复杂场景先由真实内容确定需要审阅的开始、全部关键变化和结果状态，再实现状态之间的运动；不固定状态张数，也不用模糊完成百分比代替可见结果。只有镜头平移、缩放、视差或焦点变化确实帮助解释空间关系或注意力转移时才使用镜头；纯对象显隐、数值或位置变化不为装饰套镜头。镜头、对象动画和持续可读文字各有唯一图层边界，并由同一时间线定位。

固定时长存在时，先在内容层调整取舍和表述，再生成或更新声音与画面。轻微语速调整可以用于消除小幅时间差；会损害可懂度的压缩改为修订文案或视觉结构。样稿通过后，完整成品从全量媒体文案和语义片段扩展，不把代表性样稿重复成整片。

### 4. 确定制作真源

每类成品只保留一个活动制作入口：

- **网页真源**：技术图解、多场景、动画、结构化编辑、多比例统一管理、外部渲染、复杂媒体管线或跨项目复用统一使用 editable-media v6 网页包。交互演示、图解图片和网页派生视频都从已经选定的网页真源导出，不在导出阶段升级工程。
- **视频时间线**：用户已有的实拍、讲课、访谈、录屏或多场景视频，以及需要声音装配的最终视频。先用产品无关的 `media-timeline` v1 建立可移植时间线；MediaFlow Pro 已配置且导入能力就绪时优先导入，成功后活动真源迁移为 `project.mfp`。没有可用 MediaFlow Pro 时，`media-timeline` v1 继续作为完整活动真源。
- **音频时间线**：录音、访谈、旁白和播客。
- **混合项目**：网页只负责代码生成的图形、字幕版式和动画；视频时间线只负责现有素材选择、剪切、定格、声音和最终装配。两者在装配处汇合，不互相借用生产规则。

代码生成视觉需要进入结构化媒体编辑器时，网页包继续保存结构和动画，编辑器项目只保存该片段的文字、布局、样式和时间覆盖值。人工调整和后续 AI 调整都通过编辑器公开的同一种片段状态操作完成；只有增加组件、改变结构或重写复杂动画时才修改网页包本身。

内容、样式、布局、时间线和输出设置分别集中保存。用户反馈后修改对应真源，再重新预览和导出；不把截图、GIF、音频或视频成品变成第二个编辑入口。

### 5. 选择并继承制作配方

先定表达形式，再按结构化网页、时间型视觉或专项路径的规则选择配方；只有结构化网页和系列复用才建立项目风格档案。视觉案例、布局模板、配色卡和字体预设各自只承担既定职责，不能替代当前内容与成品判断。

制作配方只决定视觉表面，不替换已定表达形式；内容、文字和构图分别读取 `editorial_position`、`voice_contract` 和当前内容关系。风格档案保存共享核心及适用实现层，不复制画布、文案、字段和分区。网页动画另定运动载体、状态和节奏；实拍、访谈、录屏和剪辑视频只在包装中继承共享核心。声音语言独立保存，不从视觉参考推导。

网页案例只证明机制、容量和验收，布局模板只提供结构，配色卡只提供颜色职责。系列或结构化项目以 `style-profile.json` 保存可复用视觉身份。“看看、参考、分析”等要求不等于采用；用户明确要求使用某张配色卡、模板或参考层时，必须在真实画面中落实，不能用读取目录或写入记录代替。案例和模板本身不创建独立静态卡入口。

### 6. 用可展示成果分阶段确认

新的或实质重做的长视频、混合视频、音频和播客统一读取 `references/staged-media-production.md`，按五阶段提交真实成果并停止；只有全自动授权才连续推进。反馈使最早受影响阶段及下游失效，保留未受影响上游；明确的低成本局部修改不为形式重走五阶段。

进入导演方向、样片、付费模型、批量制作、大规模转码或高成本渲染前，原创视频必须已经有用户确认的完整主语言字幕内容。综合样片使用已经允许的真实素材、声音和主要合成元素，覆盖会重复出现的版式或声音家族；完整预览覆盖全量内容、节奏、字幕、声音和连续性。参考样本只影响用户要求参考的层面。

### 7. 制作、检查与交付

制作只使用用户提供或明确允许查看的素材；未授权项目图片不得枚举、打开、预览、采用或影响风格。素材进入项目后由 v3 `media-sources.json` 记录文件、来源、权利、生成过程和声音身份；导入与采用分开。注册资源先解析稳定 id 和版本再显式采用，不能替代素材账本。外部搜索、付费素材、模型调用、安装和大规模转码均需明确授权；公开使用前核对许可与署名。

先检查活动真源能打开、播放和修改，再在真实浏览器或播放器中检查关键状态，最后检查指定导出。技术检查覆盖文字与字幕、裁切、层级、时间、音画同步、声音可懂度、编码、尺寸、时长和文件可用性；内容完整、受众可懂和视觉方向分别按活动真源与确认风格判断。技术通过不能写成内容或视觉通过，待确认样稿不能称为最终设计。

默认先说明载体和结果，再提供媒体文案、可编辑真源、预览或样稿、指定导出及必要规格。用户只要求其中一层时只交付该层。

## 任务路由

只读取完成当前任务需要的 reference：

| 任务 | 读取资源 | 读取目的 |
| --- | --- | --- |
| 需要在本地基础制作、MediaFlow Pro 原生增强和 HyperFrames 网页渲染之间选择 | `references/production-providers.md` | 先按真源和交付要求选定提供方；没有 MediaFlow Pro 时仍使用完整本地能力，不在失败后静默换路 |
| 已确认主语言字幕需要视觉导演，或需要决定真人、无人物及授权画面谁出镜 | `references/video-direction-contracts.md` | 绑定确认字幕与授权素材；短开场、章节路标、功能前价值主张或呼吸位主动选择全屏编辑标题卡，其它画面按关系与证据建立计划 |
| 外部生成服务的素材尚未下载并进入本地素材账本 | `references/external-generation-jobs.md` | 在素材入账前管理规范化输入、费用授权、一次性提交锁、远程恢复、实际费用和本地化 |
| 选择载体、确定媒体文案职责、分镜或节目结构 | `references/content-to-media.md` | 确定内容真源、受众称呼、媒体职责和文案合同 |
| 新写、扩写、实质重组、审查或审查后改写原创视频完整内容、口播、旁白、播客独白或主持连接语 | `references/voiceover-writing.md` | 视频先交付面向观众的主语言字幕稿，确认后派生朗读文本；音频成品仍交付可直接朗读正文 |
| 起草或派生标题、数据标签、简短字幕、画面文字、发音文本、说明文字或媒体配套帖子 | `references/media-writing.md` | 执行轻量媒体文字、等义压缩与确定性派生，不重新发明完整口播 |
| 定位或维护口播声音与完整案例 | `references/voiceover-reference-library.md` | 管理声音资格、完整案例和案例索引 |
| 检索、保存、更新或验证独立口播钩子 | `references/voiceover-hook-library.md` | 使用独立入口与索引，把连续原文交给口播写作 |
| 选择或继承视觉与动效配方 | `references/visual-production-profiles.md`、`references/visual-production-profile-recipes.md` | 只加载当前适用配方 |
| 查看、比较、采用或管理视觉案例与布局模板 | `references/visual-resource-governance.md` | 隔离证据检查、视觉采用、模板实例化和项目风格 |
| 没有用户、品牌、参考或已确认项目配色，需要为当前视觉选颜色 | `references/color-palette-production.md` | 从六张内置卡中选择一张，只继承颜色职责，不套用版式或字体 |
| 文字进入技术图解、字幕包装、网页动画或视频画面，并需要选择、继承或核对字体 | `references/typography-production.md` | 按内容职责选择标题、正文和元信息字体，记录真实来源与字重，并证明浏览器实际命中 |
| 建立或继承项目、系列的声音素材角色与混音规则 | `references/sound-production-profiles.md` | 使用独立声音档案引用真实 audio source id，不把声音规则混入视觉档案 |
| 查找、注册或采用创作者素材、通用制作素材、网页组件，发布编辑器可浏览的 MG、音效、转场、特效、缩放或 LUT 目录，或从项目晋升可复用成果 | `references/reusable-media-resources.md` | 使用不可变注册版本与带权利、预览、哈希和采用方式的目录，经现有素材账本、完整网页包或正式编辑器操作进入项目，并保存采用与晋升证据 |
| 多场景图文、GIF、HTML/React 或可拆分对象动效 | `references/web-visual-production.md`、`references/web-motion-and-derivatives.md`、`references/semantic-graphic-motion-production.md` | 建立 v6 网页真源，按内容关系制作场景与对象 |
| 技术概念、接口、工具或系统关系需要静态机制图、对比图，或保持全貌不变的动态流程图 | `references/technical-diagram-production.md` | 分配画面信息职责，建立可读机制、正交连接、稳定图层、同色流光和浏览器几何验收 |
| 把已确认的网页、桌面应用或移动产品功能制作成有真实界面证据的宣传片 | `references/product-promo-production.md` | 使用正式 profile、页面采集、镜头配方状态、功能覆盖和计划确认，并沿 `render → review → finalize` 完成真实构建、审阅与交付；拒绝把仅参考配方冒充已实现镜头 |
| 把已经确认内容真源和真实证据的 GitHub 仓库制作成约一分钟横版介绍视频 | `references/github-project-intro-production.md` | 使用 `github-project-intro@1.0.0`；沿 `create → 确认中文 content → prepare → validate → plan → confirm-plan → 综合样片 → render → review → finalize` 执行，未授权项目图片不进入候选 |
| 口播需要流程、时间线、层级、因果、工具链、比较、拆解、指标、前后证据或真人分屏等解释型画面 | `references/explanatory-broll-production.md` | 由导演计划自动选择活动模板；MediaFlow Pro 对应能力就绪时优先用它装配和导出，否则保留本地完整制作 |
| 用户明确要求按参考视频复刻、匹配、逐帧对齐或比较候选成片 | `references/reference-video-alignment.md` | 确定真实参考区间、目标还原层级、精确回放或参数化重建路径，并建立资产、运行时和交付证据 |
| 文字本身的进入、退出、替换、强调或逐字素、逐词、逐行构建承担主要表达职责 | `references/text-motion-production.md` | 从行为去重的正式目录选择效果，把分段和执行配方接入既有确定性时间线，并用当前真实文字审阅 |
| 网页视觉中使用照片、截图、产品图、生成图或视频帧 | `references/visual-asset-placement.md` | 确认素材来源，按场景槽位处理主体、文字安全区、截图完整性和各输出变体裁切 |
| 新的或实质重做的长视频、混合视频、音频、播客，或其它跨轮高成本时间型媒体 | `references/staged-media-production.md` | 用通用五阶段提交真实成果、逐阶段验收、记录全自动授权并控制局部失效范围 |
| 视频、音频或播客实际进入素材导入、Faster-Whisper XXL 转写、片段选择、长任务状态、审阅和分级交付 | `references/media-project-contracts.md` | 使用唯一素材账本、事实转写、原片与代理关系、项目状态、结构化审阅和机器可读交付报告 |
| 制作带语音的视频，或从最终旁白、最终合并视频、已复核转写生成可交付字幕 | `references/media-project-contracts.md`、`references/subtitle-production.md` | 原创视频先确认主语言字幕内容；最终声音只提供时间，再生成唯一字幕时间线、SRT、VTT 和短语级质检报告 |
| 从已有视频与事实转写制作字幕金句拼图 | `references/media-project-contracts.md`、`references/subtitle-quote-image-production.md` | 默认原片无烧录字幕；按完整观点选内容、按可读性拆显示行；中上英下、不显出处；全部同字号并复用第一句背景，每行只保留文字与最小内边距 |
| 把网页素材交给 MediaFlow Pro 继续精调、混剪、配音、字幕、外部转写，或导出透明覆盖层与普通视频 | `references/structured-media-editor-cli.md` | 从本机配置定位公开 CLI，只调用本轮声明的网页、透明媒体、Faster-Whisper XXL 或 GPT-SoVITS 操作 |
| 用户明确选择 HyperFrames，把独立的代码网页动画直接渲染成无声视频 | `references/hyperframes-rendering.md` | 从同一 editable-media v6 网页包建立渲染副本，探测实际 adapter，经动态样片门禁后渲染并核对真实成片 |
| 剪辑已有实拍、讲课、访谈、录屏或混合视频 | `references/video-post-production.md` | 先建立产品无关时间线；MediaFlow Pro 对应能力就绪时优先迁移为原生工程，否则本地完成；像素界面只承担受限操作 |
| 从电影片段、纪录素材、游戏录像、课程、产品实拍、活动记录或录屏制作视频解说，包括只有一条未经处理的源视频时 | `references/source-video-commentary-production.md` | 使用 `source-video-commentary@1.0.0`；从 `prepare` 完成获准源片入账、镜头分析、联系表和可用转写，Agent 先写并展示 authoring 中的完整主语言字幕，确认后再沿 `synthesize → confirm-narration → materialize → validate → confirm-content → plan → confirm-plan → sample → confirm-sample → render → review → confirm-preview → finalize` 制作 |
| 建立或使用无需 Live2D 的二次元口播角色 | `references/anime-avatar-production.md`、`references/anime-avatar-rendering.md` | Agent 建库并从真实语音生成口播轨 |
| 把二次元角色轨放入固定角色窗 | `references/anime-avatar-rendering.md` | 固定裁切和坐标；无声区间保持动态闭嘴 |
| 已经选定原声片段，并要用“可选原声钩子 → 必要背景 → 原声证据 → 紧接解释 → 独立总结”讲清访谈 | `references/interview-explainer-production.md` | 采用采访原声讲解型 profile，在 Skill 外项目中冻结计划、保留原声时间码、逐段渲染并分开记录机器、Agent 与用户审阅 |
| 用户明确要求 Live Photo | `references/live-photo-delivery.md` | 用同一静态构图生成配对文件，检查元数据、`.pvt`、联系表和设备导入 |
| 编辑录音、访谈、音频或播客 | `references/media-project-contracts.md` | 进入项目合同后继续读取音频与播客后期流程，建立音频时间线并完成清理、结构、混音和附属产物 |
| 用户要求合成旁白、点名 EdgeTTS 或 GPT-SoVITS，或需要为视频、动画、播客生成语音 | `references/speech-synthesis.md` | 选择声音入口，派生合成文本，生成原始语音和时间信息，并按真实时长交给媒体时间线 |
| 实际导出或交付媒体 | `references/review-and-export.md` | 沿真实链路检查源文件、预览、编码和成品 |

媒体文案先确定动作、真源、受众和渠道职责。完整内容按需读取声音案例、钩子和口播说明；库不可用时不初始化、不凑数。原创视频、长内容转视频和采访讲解都先交付完整主语言字幕稿，确认后才派生发音、译文并进入导演与渲染。

结构化网页与时间型视觉按需读取视觉配方、网页制作和语义运动说明。文字动效需要时由 `scripts/text-motion-library.mjs` 选择效果，并物化 `assets/text-motion-library/text-motion-runtime.js` 与 `assets/text-motion-library/text-motion-binding.js`。

长视频、混合视频、音频和播客先读 staged production，再从 media project starter 建立项目；综合样片后按构建计划拆分。真实人物素材先建立绑定原片哈希、经听音复核的事实转写。字幕拼图只沿 `scripts/subtitle-quote-image.py` 的 `candidates → validate → render → finalize` 运行；采访专用 profile 只运行 `scripts/interview-explainer.mjs`，不把普通素材硬套进去。

需要生成声音时读取 `references/speech-synthesis.md`；音频可视化只让网页负责视觉部分，独立播客封面不在本 Skill 制作。用户明确要求 Live Photo 时才读取对应说明。实际导出只读取 `references/review-and-export.md` 中与当前结构化网页、视频或音频相符的部分。

口播案例和钩子分别使用 `scripts/voiceover_reference_library.py`、`scripts/voiceover_hook_library.py`。二次元口播只通过 `scripts/anime-avatar-project.py`、`scripts/render-anime-avatar.py` 和 `scripts/compose-anime-avatar-inset.py`，注册库位于 `assets/anime-avatar-libraries/`；“夜希数字人”按注册资源采用，角色窗用 `scripts/self-test-anime-avatar-inset.py` 验证。采访原声讲解型和 GitHub 项目介绍只沿上表各自已经列明的完整活动命令链执行，并记录耗时、缓存与真实重试，不用省略内容确认或综合样片的快捷链，也不复制旧项目临时脚本。

## 实际制作与交付边界

结构化网页、素材处理、私人库、视频、音频、外部工具或复杂导出读取 `references/media-production-runtime.md`，并只检查当前路径实际需要的能力。HyperFrames 只在用户明确选择时使用；点名声音按 id、名称或别名唯一解析，不暗选默认。

