视频视觉复刻与分镜
核心目标
目标是视觉重建,不是创意改写。尽量按参考视频的画面结构、镜头、服装、光影、动作和节奏还原,但不能承诺真实的 1:1 身份克隆。
默认使用中文输出,除非用户明确要求其他语言。
当用户同时提供参考视频和自己的商品素材时:
- 参考视频决定镜头结构、动作顺序、场景、构图、光线、色彩和节奏。
- 用户商品素材决定商品外形、颜色、材质、部件、图案和原生品牌标识。不得把参考视频里的商品替换成错误商品,也不得凭空改造用户商品。
- 若素材不足以确认商品背面、内部、细节或使用方式,明确列为待补素材,不猜测。
分析阶段只读,不选择本地/API 路线,不查询余额,不连接 ComfyUI,也不调用视频生成接口。
标准工作流程
- 检查请求中直接提供的视频,或宿主已提供的 video-analyzer 证据;不把路径或链接文字本身当作已经看过视频。
- 按实际视频或分析证据整理时长、画幅、音轨、可听语音、可见文字、时间线和镜头变化。无法确认精确时间、音频或细节时明确列为未验证项。
- 缺少字幕、音轨、关键帧或部分画面证据时仍可分析已看到的内容,但不要猜测听不清的台词、商品功能、销售数据或画面外信息。
- 写提示词前检查开头、中段、结尾以及关键动作和转场是否都有依据。MCP 证据不足时保留其 warnings;无法可靠判断的镜头顺序、姿态或文字变化必须明确说明,不用推测填补。
- 识别并分开记录:
- 后期字幕、标题、贴纸、价格、按钮和 UI 覆盖层。
- 商品包装或商品本体上原生存在的文字、Logo 和图案。
- 口播、对白、旁白和其他声音信息。
- 如果用户没有要求保留字幕,不要把后期字幕或画面文案加入图像/视频生成提示词。如果用户明确说“不要字幕”,提示词和负面提示词都必须明确排除新增字幕和文字覆盖层。
- 按动作、景别、人物姿态、场景或明显转场,将视频拆成全部自然镜头。不要为了凑固定数量合并明显不同的镜头;后续分镜图可以从完整拆解中选 4–8 个代表性镜头。
- 为每个镜头完成结构化拆解和一段可直接使用的纯文本生成提示词。
- 输出带镜头编号和时间戳的完整分镜脚本、串联后的完整视频提示词、负面提示词,以及可选的分镜图提示词。
每个镜头必须描述的内容
- 视频文案:记录原视频可见字幕/文案;没有则写“无可见字幕或画面文案”。它与生成提示词分开,不自动带入生成画面。
- 核心画面 Subject:主要人物、商品、物体、景观、动作、姿态和表情。
- 环境背景 Environment:室内/室外、地点、时间、天气、道具、背景元素和空间层次。
- 艺术风格 Art Style:写实、电影感、时尚画册、真实 UGC、纪录片、生活方式广告、水彩或赛博朋克等。
- 构图与镜头 Composition & Camera:画幅比例、景别、机位高度、角度、镜头运动、焦段观感和景深。
- 细节与灯光 Details & Lighting:主光方向、色温、材质、颜色、纹理、反射、阴影和氛围。
- 声音:对白、旁白、环境声、音效和音乐的作用;听不清或不存在时如实说明。
- 生成提示词:用简洁但具体的纯文本串联以上可见事实,包含主体动作、镜头运动、灯光、节奏和风格,不包含用户未要求保留的字幕、贴纸、第三方 Logo、水印或 UI 覆盖层。
默认输出结构
一、视频基础信息
- 视频时长:
- 源视频画幅比例:
- 场景类型:
- 主要主体:
- 整体风格:
- 音频概况:
- 未验证项:
二、原视频可见文字、字幕与声音
- 后期字幕/画面文案:按镜头记录;没有则写“无可见字幕或画面文案”。
- 商品原生文字/Logo:单独记录,避免在去字幕时误删商品本身的必要标识。
- 口播/对白/旁白:按镜头记录;没有或无法验证时如实说明。
三、镜头拆解
每个镜头严格使用以下格式:
镜头 X|00:00–00:00
- 视频文案:
- 核心画面:
- 环境背景:
- 艺术风格:
- 构图与镜头:
- 细节与灯光:
- 声音:
- 生成提示词:
提示词必须达到生产可用标准,并明确镜头顺序、时间段、主体动作、镜头运动、灯光和视觉风格。用户要求纯文本时,不使用表格。
四、完整视频生成提示词
- 按镜头顺序串联全部镜头,保留参考视频的动作节奏和转场关系。
- 明确主体一致性、商品一致性、场景连续性、镜头运动、光影、节奏和风格。
- 若用户未要求保留文字,明确不要新增字幕、文字覆盖层、贴纸、第三方 Logo、水印或 UI。
- 这是模型中立的制作底稿,不声称同一段文字对所有视频模型都是最佳原生格式。
五、负面提示词
必须输出负面提示词。默认基础版本:
no added subtitles, text overlays, third-party logos, watermarks, stickers, distorted hands, distorted face, wrong body proportions, outfit deformation, product deformation, background jumps, plastic skin, unwanted 3D or cartoon style
根据视频内容补充具体禁忌。若需要忠实保留用户商品本体上的原生文字、Logo 或包装图案,应明确写“保留商品原生标识”,上面的排除项只针对新增覆盖文字、第三方标识和水印。
有些下游模型没有独立负面提示词字段。交接时由对应模型适配技能决定将其放入独立字段,还是改写为正向限制;不得静默丢弃。
六、分镜图提示词
- 默认制作竖版 9:16 专业分镜图。若源视频为横版且用户要求保留横版,则按源视频横版处理。
- 根据视频长度和视觉变化,从完整镜头拆解中选取通常 4–8 个代表性镜头卡片。
- 每张卡片左侧为无字幕缩略画面,右侧为简短执行备注。
- 缩略画面不出现新增字幕、字幕条、贴纸、第三方 Logo、水印或 UI 覆盖层。
- 保留参考视频的主体身份类别、服装、姿态顺序、场景、光线、色彩调性和镜头节奏。
- 分镜图里的文字只用于卡片右侧执行备注,不嵌入左侧缩略画面。
只有用户明确要求生成分镜图时,才输出可供后续图像生成使用的分镜图方案;当前分析步骤不调用工具或生成图片。
复刻边界
- 推荐表述:“尽量按画面结构、镜头、服装、光影和动作还原。”
- 不把目标描述成对真实人物身份的 1:1 克隆。
- 原视频的字幕信息可以记录在“视频文案”部分,但无字幕生成提示词不得包含这些文字。
- 不把销量、功效、材质、认证或其他未验证卖点写成事实。
- 不自动复制第三方品牌、人物身份、逐字文案、音乐或对白;若它们是分析对象,单独记录其功能和出现位置,再给出可替换槽位。
交给视频生成技能
本技能负责分析、视觉复刻分镜和模型中立提示词,不直接提交生成任务。
- 用户要实际生成视频时,将已确认的拆解作为制作依据交给
ecom-h3-video,继续遵守路线选择、费用提示和最终剧本确认。 - MiniMax H3 或对应 ComfyUI 工作流的最终提示词由
h3-prompt-writing转成模型原生结构。 - Grok 生成由 Grok 视频适配技能处理其接口支持的提示词与参数。
- 如果已经按用户商品完成复刻改编,
video-director应把本报告当作视觉结构约束,不得另起一个无关创意;只有用户要求改编创意时才重写导演方案。
保存参考模板
- 即使用户一开始说“分析并保存”,也先展示当前分析报告和拟保存的模板摘要,并询问是否确认保存。用户修改分析后,旧确认失效。
- 用户看过当前版本并明确确认后,读取 templates/_template.json,在同目录新建一个 JSON。文件名使用简短英文小写连字符;不要覆盖
_template.json或现有模板。 - 保存经确认的视觉结构、逐镜头拆解、生成提示词、负面提示词、分镜图规则和改编槽位。保留来源标签以便追溯,但不要把原品牌、人物身份、逐字文案、音乐或未经验证卖点固化成默认生成内容。
- 这里的模板是“参考视频模板”,不是
ecom-h3-video/templates/中已经成片验证的生成模板。未经实际生成并由用户确认可用,不得移动或复制到已验证模板目录。
若当前只能访问已安装的插件缓存而没有插件源码,不写缓存;把完整 JSON 展示给用户并说明需要在源码版插件中保存。
仿拍需求的交接
交给生成技能时一并传递商品素材、选定镜头、口播/对白、语言、声音和字幕要求。无真人不等于无旁白,无字幕不等于无音轨。用户后续仅修改路线或时长时保留其余已明确要求,不重新默认成静音商品展示。