Visual Multimedia
目标与边界
把成立内容转化为合适的媒体表达,并保留可修改的制作真源。Agent 负责载体判断、媒体文案、样稿、制作、修改、导出和真实结果检查;具体观点、事实、经历和来源仍由用户输入或上游内容真源决定。
适用于:
- 从确认内容中选择载体,起草或修改标题、画面文字、口播、字幕、节目结构和媒体配套帖子,并按需维护口播声音、案例和钩子库。
- 把技术图解、B-roll、动态图解、GIF 和多场景动画做成可编辑网页,再以手动、自动或混合播放派生所需媒体。
- 剪辑讲课、访谈、实拍、录屏、音频或播客,并从已有视频派生字幕金句拼图。
- 按明确参考复刻或对齐视频;建立或采用二次元口播角色;制作采访原声讲解型视频或有真实证据的 GitHub 项目介绍视频。
不适用于独立静态卡、社交卡、纯文字卡、轮播图或独立封面,也不适用于研究核查、独立文章、拍摄规划、PPTX/Keynote、账号运营与发布。仅支持从视频及事实转写派生字幕拼图,不扩展为其它静态设计;其它独立静态请求停止,不改做视频。
用户只点名本 Skill、未说明成品时,只在仍支持的载体中给出首选及理由;没有合适载体就在媒体文案后停止,不为避开静态卡强加运动。用户明确要受支持成品时直接进入对应功能区,不比较载体。
任务工作区与交付位置
所有生成任务先估算峰值字节,用 node scripts/media-task-workspace.mjs preflight --task-id <稳定任务-id> --expected-bytes <字节> 通过容量闸门,再以同一参数执行 ensure。制作真源、中间文件、预览、报告、渲染和成品都留在本 Skill 的 artifacts/<task-id>/;大型派生缓存只能进入本机已配置且有上限的缓存根。本文的“项目目录”均指该目录或其子目录。当前终端目录、活动 Git 仓库、输入项目和外部交付位置都不是生产目录。结束时运行 inventory 和 finalize --status completed|failed|interrupted;没有删除授权只报告清理候选。
用户点名外部交付目录时,仍先在 Skill 内制作和检查,只复制最终文件;Skill 内真源、报告和成品继续保留,外部副本不成为修改入口。外部产品服从自身配置,但可移交真源、快照或交付结果必须收回任务目录。未点名外部交付时,不向其它项目写生成文件。
当前视频默认基线
中文视频最终默认显示中文主字幕,下方为英文小字幕,两层共用真实声音边界。原创中文视频先交完整中文字幕,确认后再做英文、声音、方向和样片;中文变化使下游失效。合成旁白默认使用注册声音 game.honkai-star-rail.silverwolf.default,由 GPT-SoVITS speech.synthesize 以 speed_factor: 1.25 生成。中文句子中的英文、缩写和英文专名保留正式拼写,与中文整句混合合成;实际试听确认读音异常后,才在项目发音表中改用中文谐音并重新整句合成。字幕和屏幕文字仍用正式写法,不默认拆分中英文音频。用户指定其它读法或声音时覆盖这一基线。真人原声或现成旁白先确认复核转写整理出的主字幕,再按真实声音定时。
入口判断与内部边界
先确定成品、确认内容、受众、已授权素材和规格,再选路径。没有明确点名或授权时,不搜索、不枚举、不打开、不预览这些视觉文件。各功能区只接收所需内容、已授权素材和确认结果:
- 用户已经指定独立静态卡、社交卡、纯文字卡、轮播图或独立封面时,按目标边界停止,不创建 HTML、画布或图片,也不把请求升级成结构化网页。
- 用户没有指定载体或确实需要跨媒体组合时,才读取
references/content-to-media.md。 - 可编辑网页视觉统一使用 editable-media v6;多场景、动画、结构化编辑、多比例统一管理、MediaFlow Pro、HyperFrames、复杂媒体管线或跨项目网页组件仍按各自需要启用。
- 视频、音频、播客和二次元角色只在用户要求对应成品时进入自己的 reference。退出范围内的静态请求不会启动这些功能。
- 运行时和导出检查服从已选路径,不反过来扩大成品范围或重新决定内容、尺寸和视觉方向。
建立二次元口播角色时读取 references/anime-avatar-production.md。只有母版时,先提供 assets/anime-avatar-prompts/motion-source-video.md 的完整提示词和合格条件;完整制作且外部生成已获授权时直接提交。已有校准视频时由 Agent 检查画面,并完成裁切、联系表、口型标注、机器文件和验证;不要求用户逐帧整理素材、编辑 JSON、运行内部命令或确认技术计划。
无骨骼路径使用校准视频的完整人物帧,适合克制动作和普通话口型大体同步。明显动作与高精度口型不能稳定兼得时,在生成前停止并让用户选择音频驱动或分层、骨骼系统。角色建库不套长视频五阶段;confirm-plan 只确认 Agent 已检查技术计划。
默认模式下,用户已经说清时直接执行;缺失信息只影响局部时从现有内容采用保守且可逆的选择。缺口会改变大部分文案、载体、构图或剪辑时,先读取材料和项目规则,仍无法确定再询问一个关键问题。生产位置不属于待猜测输入,始终由本 Skill 的任务工作区确定。
当前请求处于 Plan 模式时,无论上述信息是否已经完整,都先读取 references/plan-mode-creative-interview.md;本 Skill 不自动开启或关闭 Plan 模式。
内容真源不完整时,只补齐媒体表达所需的结构,不自行发明事实、第一人称经历、来源或作者立场。需要外部研究或事实核查时,先说明缺口并取得对应授权;未获得授权时停在现有材料能够支持的范围。
网页视觉、图解或视频包装的输入是研究材料、长稿或尚未确认的草稿时,由当前媒体文案路径直接整理成观众可见文字;完整视频内容读取 references/voiceover-writing.md,轻量画面文字读取 references/media-writing.md。只有用户明确点名 clean-copy 时才交给它处理已有文字。已经确认最终上图文字时不再改写,视觉制作只读取确认后的观众可见文字。
个人或系列内容带有上游确认的 editorial_position 与 voice_contract 时分别读取:前者决定媒体文案强调什么、如何评价和说到哪里,后者决定视角、推进、句子节奏、幽默和结尾。两者缺失时沿当前内容真源与用户已确认文案制作,不从视觉参考、制作配方或平台模板推导作者观点和口吻。
同一来源准备派生多个成品,或者当前任务属于连续系列时,读取上游提供的来源标识、来源版本和内容单元标识。每个媒体项目保留这组来源信息,并另外记录项目标识、当前媒体文案版本和实际导出物;来源版本发生变化时,先核对受影响项目使用的主张、素材与文案,再继续导出。
默认正向流程
1. 选择具体载体
根据内容怎样成立和现有素材选择一个首选载体:
- 技术机制、接口、系统关系、流程或比较确实需要空间关系才能看懂时,优先技术图解;只靠一段文字或清单就能成立、又没有合适时间型载体时,完成媒体文案后停止。
- 状态变化、数值变化、循环、反馈、局部演示或需要原位逐步显现的关系,优先 GIF 或动态图解。
- 由代码画面承担的多场景推进、逐步揭示或现场讲解,优先网页动画;需要演讲者决定何时推进时使用手动播放,需要连续观看或导出时使用自动播放,需要页内自动运动但在章节边界等待时使用混合播放。
- 人物表达、故事、访谈、讲课、实拍、录屏,或多场景价值主要来自连续声音和镜头时,优先视频。
- 主要价值来自讲述、对谈、访谈、声音氛围或适合伴随收听的连续内容,优先音频或播客。
同一内容适合多个载体时,结合目标受众、已有素材、平台规格、制作成本和信息损失给出一个首选。只有备选能够提供不同的真实价值时才补充。
2. 先完成并筛选媒体文案
制作前先固定标题、节目结构、主字幕和事实边界。原创带语音视频的第一份用户可见成果必须是完整主语言字幕内容,不是提纲、英文、配音、方向或样片;确认后再派生其它内容。
技术图解、网页视觉和视频包装只接收已经确认的最终上图文字;内容尚未确认时先完成上一节的清理与确认,不在视觉功能区再建一套筛选规则。
主字幕按观众理解顺序写,用普通话说明对象、用途、观看价值和事实结果。内部字段与维护术语不进入字幕;必要术语先解释观众能复述的关系。确认后再分配旁白与画面职责。
先选写作动作:只审查就诊断后停止;新写、扩写、重组或改写完整内容时,先确定观众和观看价值,再从确认材料、声音证据及用户指定或适用的完整参考直接写主语言字幕。制作顺序、内部合同和验收不自动成为观众内容。确认后才派生朗读文本。AI 句式是上层问题症状,不建禁词表;术语取舍由观众理解需要决定。错字、格式、等义压缩、短标题、数据标签和简短字幕走轻量路径。
每轮修改综合原始请求、活动真源、有效确认和最新反馈。“在当前基础上优化”保留真源、已确认内容和未被否定的约束。用户指出丑、字小、太密或空白过多时,先定位为内容重排、局部换装或整体改版,只让受影响层失效。“太丑”本身不等于整体改版;沿当前基础优化时不得换模板或从空白重建。内容或比例变化后重新计算整张画布。
媒体文案默认由当前模型起草,点名其它生产者时才切换;都使用同一净化材料、声音和参考,并完成同一回读。逐字引用、数据标签、来源和确认内容保持原样。
个人或系列媒体文案先按 editorial_position 选信息与评价方向,再从明确指令、声音样稿、口播真源和同语境合格候选生成 voice_contract。缺少个人声音证据时保持普通直接,不从案例、钩子或 AI 草稿推导。时长与密度由成品职责决定。
已确认最终上图文字时不再改写;只有材料或长稿时由当前媒体文案路径形成并确认上图文字。技术图解、网页视觉和视频包装按阅读目的选择文字、表格、图形、图片或组合;图形仅在更易理解或用户明确要求时使用。只要求文案时交付后停止。
3. 建立语义片段和时间结构
时间型媒体先把已确认的主语言字幕稿拆成连续语义片段,记录新增信息、声音范围、画面职责、进入退出和真实时长来源。用户未点名 B-roll 也要逐段判断:能增加证据、场景、动作、情绪、结果或剪切连贯性才采用,否则保持现有画面,不逐句切换。代码生成网页把片段变成场景和步骤;实拍或录屏剪辑只从已明确提供或授权的素材选取、定格和切点,不建网页场景。生成、采用或录制声音后,以实际音频更新时间边界,但不反向改写已经确认的字幕含义。制作备注、暂停提示、调试信息和审阅标签不进入观众可见字段。
代码生成网页的运动按当前含义选择:持续现象使用片段内循环;方向性变化完成一次演进后保持结果;反馈关系使用保留累积状态的局部循环;比较保持可同时读取;概念切换承接前后对象;结论允许稳定停留。需要延长网页画面时,只延长当前片段的运动或状态。已有素材怎样补足时长只由视频后期路径决定。
无实拍视频、代码动画或动态图解由运动本身承担主要表达时,在实现前再确定贯穿当前段落或相邻场景的运动载体、它的开始和结束状态、真正改变含义的动作、前后承接锚点以及文字只负责什么。承担推进、因果、转折或兑现的片段必须让状态变化直接可见;结论、证据阅读和刻意停顿可以稳定保持。不能用标题、卡片或截图轮流淡入代替本应由对象关系和状态变化表达的内容。
代码动画的每个步骤都写明开始、变化、结果或保持状态及其实际含义。复杂场景先由真实内容确定需要审阅的开始、全部关键变化和结果状态,再实现状态之间的运动;不固定状态张数,也不用模糊完成百分比代替可见结果。只有镜头平移、缩放、视差或焦点变化确实帮助解释空间关系或注意力转移时才使用镜头;纯对象显隐、数值或位置变化不为装饰套镜头。镜头、对象动画和持续可读文字各有唯一图层边界,并由同一时间线定位。
固定时长存在时,先在内容层调整取舍和表述,再生成或更新声音与画面。轻微语速调整可以用于消除小幅时间差;会损害可懂度的压缩改为修订文案或视觉结构。样稿通过后,完整成品从全量媒体文案和语义片段扩展,不把代表性样稿重复成整片。
4. 确定制作真源
每类成品只保留一个活动制作入口:
- 网页真源:技术图解、多场景、动画、结构化编辑、多比例统一管理、外部渲染、复杂媒体管线或跨项目复用统一使用 editable-media v6 网页包。交互演示、图解图片和网页派生视频都从已经选定的网页真源导出,不在导出阶段升级工程。
- 视频时间线:用户已有的实拍、讲课、访谈、录屏或多场景视频,以及需要声音装配的最终视频。先用产品无关的
media-timelinev1 建立可移植时间线;MediaFlow Pro 已配置且导入能力就绪时优先导入,成功后活动真源迁移为project.mfp。没有可用 MediaFlow Pro 时,media-timelinev1 继续作为完整活动真源。 - 音频时间线:录音、访谈、旁白和播客。
- 混合项目:网页只负责代码生成的图形、字幕版式和动画;视频时间线只负责现有素材选择、剪切、定格、声音和最终装配。两者在装配处汇合,不互相借用生产规则。
代码生成视觉需要进入结构化媒体编辑器时,网页包继续保存结构和动画,编辑器项目只保存该片段的文字、布局、样式和时间覆盖值。人工调整和后续 AI 调整都通过编辑器公开的同一种片段状态操作完成;只有增加组件、改变结构或重写复杂动画时才修改网页包本身。
内容、样式、布局、时间线和输出设置分别集中保存。用户反馈后修改对应真源,再重新预览和导出;不把截图、GIF、音频或视频成品变成第二个编辑入口。
5. 选择并继承制作配方
先定表达形式,再按结构化网页、时间型视觉或专项路径的规则选择配方;只有结构化网页和系列复用才建立项目风格档案。视觉案例、布局模板、配色卡和字体预设各自只承担既定职责,不能替代当前内容与成品判断。
制作配方只决定视觉表面,不替换已定表达形式;内容、文字和构图分别读取 editorial_position、voice_contract 和当前内容关系。风格档案保存共享核心及适用实现层,不复制画布、文案、字段和分区。网页动画另定运动载体、状态和节奏;实拍、访谈、录屏和剪辑视频只在包装中继承共享核心。声音语言独立保存,不从视觉参考推导。
网页案例只证明机制、容量和验收,布局模板只提供结构,配色卡只提供颜色职责。系列或结构化项目以 style-profile.json 保存可复用视觉身份。“看看、参考、分析”等要求不等于采用;用户明确要求使用某张配色卡、模板或参考层时,必须在真实画面中落实,不能用读取目录或写入记录代替。案例和模板本身不创建独立静态卡入口。
6. 用可展示成果分阶段确认
新的或实质重做的长视频、混合视频、音频和播客统一读取 references/staged-media-production.md,按五阶段提交真实成果并停止;只有全自动授权才连续推进。反馈使最早受影响阶段及下游失效,保留未受影响上游;明确的低成本局部修改不为形式重走五阶段。
进入导演方向、样片、付费模型、批量制作、大规模转码或高成本渲染前,原创视频必须已经有用户确认的完整主语言字幕内容。综合样片使用已经允许的真实素材、声音和主要合成元素,覆盖会重复出现的版式或声音家族;完整预览覆盖全量内容、节奏、字幕、声音和连续性。参考样本只影响用户要求参考的层面。
7. 制作、检查与交付
制作只使用用户提供或明确允许查看的素材;未授权项目图片不得枚举、打开、预览、采用或影响风格。素材进入项目后由 v3 media-sources.json 记录文件、来源、权利、生成过程和声音身份;导入与采用分开。注册资源先解析稳定 id 和版本再显式采用,不能替代素材账本。外部搜索、付费素材、模型调用、安装和大规模转码均需明确授权;公开使用前核对许可与署名。
先检查活动真源能打开、播放和修改,再在真实浏览器或播放器中检查关键状态,最后检查指定导出。技术检查覆盖文字与字幕、裁切、层级、时间、音画同步、声音可懂度、编码、尺寸、时长和文件可用性;内容完整、受众可懂和视觉方向分别按活动真源与确认风格判断。技术通过不能写成内容或视觉通过,待确认样稿不能称为最终设计。
默认先说明载体和结果,再提供媒体文案、可编辑真源、预览或样稿、指定导出及必要规格。用户只要求其中一层时只交付该层。
任务路由
只读取完成当前任务需要的 reference:
| 任务 | 读取资源 | 读取目的 |
|---|---|---|
| 需要在本地基础制作、MediaFlow Pro 原生增强和 HyperFrames 网页渲染之间选择 | references/production-providers.md |
先按真源和交付要求选定提供方;没有 MediaFlow Pro 时仍使用完整本地能力,不在失败后静默换路 |
| 已确认主语言字幕需要视觉导演,或需要决定真人、无人物及授权画面谁出镜 | references/video-direction-contracts.md |
绑定确认字幕与授权素材;短开场、章节路标、功能前价值主张或呼吸位主动选择全屏编辑标题卡,其它画面按关系与证据建立计划 |
| 外部生成服务的素材尚未下载并进入本地素材账本 | references/external-generation-jobs.md |
在素材入账前管理规范化输入、费用授权、一次性提交锁、远程恢复、实际费用和本地化 |
| 选择载体、确定媒体文案职责、分镜或节目结构 | references/content-to-media.md |
确定内容真源、受众称呼、媒体职责和文案合同 |
| 新写、扩写、实质重组、审查或审查后改写原创视频完整内容、口播、旁白、播客独白或主持连接语 | references/voiceover-writing.md |
视频先交付面向观众的主语言字幕稿,确认后派生朗读文本;音频成品仍交付可直接朗读正文 |
| 起草或派生标题、数据标签、简短字幕、画面文字、发音文本、说明文字或媒体配套帖子 | references/media-writing.md |
执行轻量媒体文字、等义压缩与确定性派生,不重新发明完整口播 |
| 定位或维护口播声音与完整案例 | references/voiceover-reference-library.md |
管理声音资格、完整案例和案例索引 |
| 检索、保存、更新或验证独立口播钩子 | references/voiceover-hook-library.md |
使用独立入口与索引,把连续原文交给口播写作 |
| 选择或继承视觉与动效配方 | references/visual-production-profiles.md、references/visual-production-profile-recipes.md |
只加载当前适用配方 |
| 查看、比较、采用或管理视觉案例与布局模板 | references/visual-resource-governance.md |
隔离证据检查、视觉采用、模板实例化和项目风格 |
| 没有用户、品牌、参考或已确认项目配色,需要为当前视觉选颜色 | references/color-palette-production.md |
从六张内置卡中选择一张,只继承颜色职责,不套用版式或字体 |
| 文字进入技术图解、字幕包装、网页动画或视频画面,并需要选择、继承或核对字体 | references/typography-production.md |
按内容职责选择标题、正文和元信息字体,记录真实来源与字重,并证明浏览器实际命中 |
| 建立或继承项目、系列的声音素材角色与混音规则 | references/sound-production-profiles.md |
使用独立声音档案引用真实 audio source id,不把声音规则混入视觉档案 |
| 查找、注册或采用创作者素材、通用制作素材、网页组件,发布编辑器可浏览的 MG、音效、转场、特效、缩放或 LUT 目录,或从项目晋升可复用成果 | references/reusable-media-resources.md |
使用不可变注册版本与带权利、预览、哈希和采用方式的目录,经现有素材账本、完整网页包或正式编辑器操作进入项目,并保存采用与晋升证据 |
| 多场景图文、GIF、HTML/React 或可拆分对象动效 | references/web-visual-production.md、references/web-motion-and-derivatives.md、references/semantic-graphic-motion-production.md |
建立 v6 网页真源,按内容关系制作场景与对象 |
| 技术概念、接口、工具或系统关系需要静态机制图、对比图,或保持全貌不变的动态流程图 | references/technical-diagram-production.md |
分配画面信息职责,建立可读机制、正交连接、稳定图层、同色流光和浏览器几何验收 |
| 把已确认的网页、桌面应用或移动产品功能制作成有真实界面证据的宣传片 | references/product-promo-production.md |
使用正式 profile、页面采集、镜头配方状态、功能覆盖和计划确认,并沿 render → review → finalize 完成真实构建、审阅与交付;拒绝把仅参考配方冒充已实现镜头 |
| 把已经确认内容真源和真实证据的 GitHub 仓库制作成约一分钟横版介绍视频 | references/github-project-intro-production.md |
使用 github-project-intro@1.0.0;沿 create → 确认中文 content → prepare → validate → plan → confirm-plan → 综合样片 → render → review → finalize 执行,未授权项目图片不进入候选 |
| 口播需要流程、时间线、层级、因果、工具链、比较、拆解、指标、前后证据或真人分屏等解释型画面 | references/explanatory-broll-production.md |
由导演计划自动选择活动模板;MediaFlow Pro 对应能力就绪时优先用它装配和导出,否则保留本地完整制作 |
| 用户明确要求按参考视频复刻、匹配、逐帧对齐或比较候选成片 | references/reference-video-alignment.md |
确定真实参考区间、目标还原层级、精确回放或参数化重建路径,并建立资产、运行时和交付证据 |
| 文字本身的进入、退出、替换、强调或逐字素、逐词、逐行构建承担主要表达职责 | references/text-motion-production.md |
从行为去重的正式目录选择效果,把分段和执行配方接入既有确定性时间线,并用当前真实文字审阅 |
| 网页视觉中使用照片、截图、产品图、生成图或视频帧 | references/visual-asset-placement.md |
确认素材来源,按场景槽位处理主体、文字安全区、截图完整性和各输出变体裁切 |
| 新的或实质重做的长视频、混合视频、音频、播客,或其它跨轮高成本时间型媒体 | references/staged-media-production.md |
用通用五阶段提交真实成果、逐阶段验收、记录全自动授权并控制局部失效范围 |
| 视频、音频或播客实际进入素材导入、Faster-Whisper XXL 转写、片段选择、长任务状态、审阅和分级交付 | references/media-project-contracts.md |
使用唯一素材账本、事实转写、原片与代理关系、项目状态、结构化审阅和机器可读交付报告 |
| 制作带语音的视频,或从最终旁白、最终合并视频、已复核转写生成可交付字幕 | references/media-project-contracts.md、references/subtitle-production.md |
原创视频先确认主语言字幕内容;最终声音只提供时间,再生成唯一字幕时间线、SRT、VTT 和短语级质检报告 |
| 从已有视频与事实转写制作字幕金句拼图 | references/media-project-contracts.md、references/subtitle-quote-image-production.md |
默认原片无烧录字幕;按完整观点选内容、按可读性拆显示行;中上英下、不显出处;全部同字号并复用第一句背景,每行只保留文字与最小内边距 |
| 把网页素材交给 MediaFlow Pro 继续精调、混剪、配音、字幕、外部转写,或导出透明覆盖层与普通视频 | references/structured-media-editor-cli.md |
从本机配置定位公开 CLI,只调用本轮声明的网页、透明媒体、Faster-Whisper XXL 或 GPT-SoVITS 操作 |
| 用户明确选择 HyperFrames,把独立的代码网页动画直接渲染成无声视频 | references/hyperframes-rendering.md |
从同一 editable-media v6 网页包建立渲染副本,探测实际 adapter,经动态样片门禁后渲染并核对真实成片 |
| 剪辑已有实拍、讲课、访谈、录屏或混合视频 | references/video-post-production.md |
先建立产品无关时间线;MediaFlow Pro 对应能力就绪时优先迁移为原生工程,否则本地完成;像素界面只承担受限操作 |
| 从电影片段、纪录素材、游戏录像、课程、产品实拍、活动记录或录屏制作视频解说,包括只有一条未经处理的源视频时 | references/source-video-commentary-production.md |
使用 source-video-commentary@1.0.0;从 prepare 完成获准源片入账、镜头分析、联系表和可用转写,Agent 先写并展示 authoring 中的完整主语言字幕,确认后再沿 synthesize → confirm-narration → materialize → validate → confirm-content → plan → confirm-plan → sample → confirm-sample → render → review → confirm-preview → finalize 制作 |
| 建立或使用无需 Live2D 的二次元口播角色 | references/anime-avatar-production.md、references/anime-avatar-rendering.md |
Agent 建库并从真实语音生成口播轨 |
| 把二次元角色轨放入固定角色窗 | references/anime-avatar-rendering.md |
固定裁切和坐标;无声区间保持动态闭嘴 |
| 已经选定原声片段,并要用“可选原声钩子 → 必要背景 → 原声证据 → 紧接解释 → 独立总结”讲清访谈 | references/interview-explainer-production.md |
采用采访原声讲解型 profile,在 Skill 外项目中冻结计划、保留原声时间码、逐段渲染并分开记录机器、Agent 与用户审阅 |
| 用户明确要求 Live Photo | references/live-photo-delivery.md |
用同一静态构图生成配对文件,检查元数据、.pvt、联系表和设备导入 |
| 编辑录音、访谈、音频或播客 | references/media-project-contracts.md |
进入项目合同后继续读取音频与播客后期流程,建立音频时间线并完成清理、结构、混音和附属产物 |
| 用户要求合成旁白、点名 EdgeTTS 或 GPT-SoVITS,或需要为视频、动画、播客生成语音 | references/speech-synthesis.md |
选择声音入口,派生合成文本,生成原始语音和时间信息,并按真实时长交给媒体时间线 |
| 实际导出或交付媒体 | references/review-and-export.md |
沿真实链路检查源文件、预览、编码和成品 |
媒体文案先确定动作、真源、受众和渠道职责。完整内容按需读取声音案例、钩子和口播说明;库不可用时不初始化、不凑数。原创视频、长内容转视频和采访讲解都先交付完整主语言字幕稿,确认后才派生发音、译文并进入导演与渲染。
结构化网页与时间型视觉按需读取视觉配方、网页制作和语义运动说明。文字动效需要时由 scripts/text-motion-library.mjs 选择效果,并物化 assets/text-motion-library/text-motion-runtime.js 与 assets/text-motion-library/text-motion-binding.js。
长视频、混合视频、音频和播客先读 staged production,再从 media project starter 建立项目;综合样片后按构建计划拆分。真实人物素材先建立绑定原片哈希、经听音复核的事实转写。字幕拼图只沿 scripts/subtitle-quote-image.py 的 candidates → validate → render → finalize 运行;采访专用 profile 只运行 scripts/interview-explainer.mjs,不把普通素材硬套进去。
需要生成声音时读取 references/speech-synthesis.md;音频可视化只让网页负责视觉部分,独立播客封面不在本 Skill 制作。用户明确要求 Live Photo 时才读取对应说明。实际导出只读取 references/review-and-export.md 中与当前结构化网页、视频或音频相符的部分。
口播案例和钩子分别使用 scripts/voiceover_reference_library.py、scripts/voiceover_hook_library.py。二次元口播只通过 scripts/anime-avatar-project.py、scripts/render-anime-avatar.py 和 scripts/compose-anime-avatar-inset.py,注册库位于 assets/anime-avatar-libraries/;“夜希数字人”按注册资源采用,角色窗用 scripts/self-test-anime-avatar-inset.py 验证。采访原声讲解型和 GitHub 项目介绍只沿上表各自已经列明的完整活动命令链执行,并记录耗时、缓存与真实重试,不用省略内容确认或综合样片的快捷链,也不复制旧项目临时脚本。
实际制作与交付边界
结构化网页、素材处理、私人库、视频、音频、外部工具或复杂导出读取 references/media-production-runtime.md,并只检查当前路径实际需要的能力。HyperFrames 只在用户明确选择时使用;点名声音按 id、名称或别名唯一解析,不暗选默认。