Andy Paper Collage Explainer - 高级半调纸拼贴动画生成器
一句话能力:把一句配音/旁白、一个故事主题、观点句或抽象概念,转化为统一的编辑感纸拼贴动画序列。
视觉语言是 高级半调纸拼贴:大色块纸面、黑白半调照片剪影、选择性彩色卡纸点缀、暖白描边、柔和纸影、触感定格组装,以及清晰的拼贴音效。
适用场景
当用户需要以下内容时使用:
- 把一句脚本或观点转成视觉隐喻拼贴动画
- 用拼贴 B-roll 解释简单故事、文学主题或知识点
- 为配音/旁白或社交视频制作编辑感纸拼贴动画
- 制作从空色纸背景中逐步组装物件的半调拼贴动画
- 把多条抽象句子或故事节点批量转为独立视觉隐喻动画
- 制作带纸片滑动、弹入、压平、轻响和摩擦声的触感知识短片,但不默认加音乐或配音/旁白
不适用于:
- 写实产品广告或真人出镜配音/旁白视频
- 精确可编辑图层、时间线关键帧或透明切片素材
- 精确 Logo 位置或可读长文字排版
- 只需要视频提示词、不需要生成媒体
默认创作目标
除非用户另有说明:
- 输出画幅:16:9 横版
- 单段时长:每段约 4 秒
- 默认音频:保留或生成触感纸拼贴音效(纸片滑动、弹入、压平轻敲、轻微摩擦、小纸片脆响)
- 默认不添加 BGM:可询问用户是否需要 BGM,只有用户明确要求时才添加
- 默认不添加旁白/配音:可询问用户是否需要旁白讲解/配音/旁白,只有用户明确要求时才写稿、配音或加入人声
- 默认不添加字幕:可询问用户是否需要字幕,只有用户明确要求时才生成或烧录字幕
- 视觉风格:高级编辑感半调纸拼贴
- 运动风格:触感停格组装,不使用慢速缩放、泛泛漂浮或平滑数字图层移动
- 默认视频生成模型:
MiniMax-H3,除非用户明确指定、该模型不可用或硬性能力要求排除它 - 图像/视频中文字:避免可读字母、数字、UI、字幕、水印和 Logo
- 图像质量与层次:优先生成好看的 16:9 层次构图,前景/中景/背景清楚,主体层级强,画面丰富但易读,留白可控
音频策略
这个 Skill 的默认交付是:带拼贴音效,默认不添加 BGM、旁白/配音和字幕。
- 第一次制作方案确认时,必须明确写出默认媒体方式:保留或生成触感拼贴音效;默认不添加 BGM、旁白/配音和字幕,除非用户明确要求。
- 对科普或讲解类内容,可以询问用户是否需要旁白讲解/配音/旁白、BGM 或字幕,但必须把它们作为可选增强,而不是默认项。
- 不要因为用户要"科普/讲解视频"就自动推断需要人声旁白。若用户没有选择旁白,就写无声视觉叙事节奏,而不是旁白稿。
- 不要因为用户要"社交视频"就自动推断需要 BGM 或字幕。若用户没有选择,就只保留拼贴音效。
- 生成视频片段时,如果模型支持音频,默认要求同步触感拼贴音效:纸片滑动、弹入、压平轻敲、轻微摩擦和小纸片脆响。
- 最终合成时,如果原片段音轨是拼贴音效,默认保留这些原始音轨,不要默认丢弃音频。
- 只有当用户要求静音、生成音频中出现不需要的人声/音乐,或用户要求另行混入音乐/旁白时,才移除或替换音频。只有用户明确要求时才生成或烧录字幕。
全局风格规则
对每张静帧和每段视频应用以下规则:
- 统一整体风格。每段都应像同一套编辑感纸拼贴系列:半调剪影、大色块、暖白描边、柔和实体纸影、干净构图、触感纸材和协调的拼贴音效。
- 控制纸张质感强度。纸张不能像完全扁平数字图层,也不能变得过旧、脏、皱或偏棕,除非用户明确要求。优先使用干净精致的手工纸质感:细纤维、轻微不规则撕边、浅层毛边、层叠接缝和软阴影。
- 统一色彩基调。不要在未经确认时引入与静帧或整体色板冲突的牛皮纸、棕色、发黄或做旧底纸。每段从与已确认静帧主色一致的纸面开始。
- 让运动像停格拼贴。使用明确纸片动作:逐片出现、滑入或弹入、轻微回弹、压平、暂停,然后锁定最终构图。避免快速旋转、过度翻飞、混乱飞散、全局淡入、平滑数字平移/缩放或泛泛漂浮。
- 保持段落协调。当前一两段建立了批次风格和音效节奏后,后续片段和修订应参考该节奏与色调,让整支片子像同一系列。
- 默认制作精致 16:9 层次场景。除非用户明确要求其他平台画幅,默认按 16:9 横版规划和生成。利用宽画幅建立前景/中景/背景层次、丰富环境道具、清晰主体层级和横向构图,不让画面变碎。
- 突出纸拼贴工艺。每张静帧和每段视频都应让拼贴方法可见:可分离纸片组、半调照片剪影、彩色卡纸点缀、触感阴影、撕边、层叠接缝,以及弹入、滑入、轻微回弹、压平、暂停、锁定等停格动作。
STEP 1:解析输入
针对每条句子、概念、故事或主题,提炼:
- 核心含义:观众应该理解什么
- 情绪:平静、紧迫、讽刺、惊奇、荒诞、澄清、反思、神秘或轻快
- 动作动词:打开、连接、泄漏、归档、压缩、分裂、照亮、绑定、组装、揭示、坠落、追逐、转化、碰撞
- 视觉隐喻:不用屏幕文字也能表达含义的具体画面
- 关键物件:3–6 个大而易读的纸片组
- 音效含义:该段适合纸片滑动、弹入、压平、轻敲、摩擦还是脆响
若是故事主题,除非用户指定段落数,否则拆为 3–6 个简洁节点。相似节点可共享设计语言,但每段应有不同隐喻、物件、色场和音效节奏。
STEP 2:Gate 1 — 制作方案确认
在生成任何媒体前,先创建简洁制作方案文档,并等待用户确认。用户确认前不要生成静帧或视频。
制作方案必须包含:
Brief
- 主题或原始句子
- 已知的目标受众/使用场景
- 画幅和时长假设
- 语气与节奏
- 视觉风格摘要
- 媒体方案,明确写为:默认保留或生成拼贴音效;默认不添加 BGM、旁白/配音和字幕,除非用户明确要求
- 可选增强问题:需要时可以询问用户是否要旁白讲解/配音/旁白、BGM 或字幕,但必须保持为可选项
视觉隐喻
每个计划段落包含:
- 核心含义
- 情绪
- 一句话视觉提案
- 3–6 个关键物件
- 建议背景色和强调色
- 预计组装顺序
- 预计拼贴音效点,例如滑入、弹入、压平、轻敲、摩擦或脆响
脚本 / 视觉节奏轨
只有当用户明确要求旁白时,才写简洁旁白稿。若用户没有明确要求旁白,不要写旁白稿;改为写无旁白视觉节奏轨,说明观众将通过画面理解什么。 如果用户只需要为已有句子制作 B-roll,则保留原句作为上下文,不要发明旁白。
分镜
每个段落包含:
- 段落标题
- 最终画面描述
- 动效想法
- 近似时长
- 拼贴音效想法
- 风格连续性和色彩协调说明
展示制作方案后,等待用户批准、否定或修改。如果用户只批准部分编号,只推进已批准部分并修改其余部分。
STEP 3:建立静帧规格
制作方案确认后,为每个已批准段落写紧凑的视觉规格,规格应能直接用于图像生成。
包含:
- 脚本含义或故事节点
- 视觉隐喻
- 画幅
- 背景色场
- 强调色
- 关键物件组及作用
- 构图、前景/中景/背景层次与留白
- 最终画面关系
- 风格连续性说明
- 该静帧的避免项
使用以下风格签名:
flat bold color field, black-and-white halftone photographic cut-outs, selective colored cardstock accents, warm cream keylines, soft paper shadows, fine uncoated-paper grain, premium editorial paper collage, clean refined hand-torn paper edges, subtle fibrous edges, layered paper seams
色彩建议:
- 焦橙或红色:劳动、时间压力、紧迫感
- 芥末黄:工具、警示、累积错误
- 墨绿:认知、重置、判断、超现实平静
- 深紫:记忆、结构、神秘、梦境逻辑
- 青绿:协作、执行、系统流动
- 玫红:荒诞、仪式、戏剧张力
不要把钴蓝作为自动默认色。通过纸张质感、半调处理、描边、阴影、画幅和受控色板统一整批画面。只有当故事节点需要对比时才变化色场。
STEP 4:Gate 2 — 生成并确认静帧
为每个已批准段落生成一张最终静帧。静帧应看起来像未来动画的完成最后一帧。
静帧要求:
- 使用用户指定画幅;否则默认 16:9 横版
- 扁平大色块纸背景,带细微纤维质感
- 3–6 个大的可分离物件组,除非已批准分镜确实需要略多
- 主体清楚、视觉层级强、留白干净,并有可见前景/中景/背景层次
- 以黑白半调照片剪影为主要结构,结合丰富但易读的场景道具支撑故事节点
- 仅在强化层级时使用选择性彩色卡纸强调
- 暖白描边、柔和实体纸影、精致撕边和轻微层叠纸缝
- 不出现可读文字、假字母、数字、字幕、UI、水印或 Logo,除非用户明确要求
展示生成的静帧,并在视频生成前等待用户确认。如果静帧太忙、色彩不匹配、纸层过多、边缘太数字化或纸张过旧/过棕,应先修订静帧再生成视频。
STEP 5:规划停格组装
对每张已批准静帧,准备运动方案,并把已批准静帧视为完成最终画面。
默认运动顺序:
- 从与已批准静帧主背景一致的干净纸色场开始,而不是不匹配的牛皮纸或棕色底。
- 基础结构作为纸片滑入、弹入或压入。
- 角色、卡片、物件或主要隐喻元素入场。
- 次要物件逐个组装,带小幅回弹、压平和暂停。
- 最终关系锁定到已批准构图。
- 结尾短暂停留在完整静帧式画面上。
运动提示词指导:
Paper-collage stop-motion assembly. Start on a clean paper field matching the approved still's background color and tone. Assemble the scene piece by piece with tactile stop-motion timing: foreground, midground, and background paper groups appear in a readable order; each paper object appears, slides or pops in, lightly bounces, presses flat, pauses, and locks into place. Preserve the halftone dots, cream keylines, subtle fibrous torn edges, layered paper seams, soft shadows, paper grain, color field, and approved aspect ratio. End by holding the completed composition matching the approved still frame. Sound design: tactile collage SFX only, synchronized to paper-piece motion: soft paper slide, pop-in, press-flat tap, light rustle, and tiny paper snap where appropriate. Default: do not add BGM, voiceover, dialogue, or subtitles unless the user explicitly requested them. No mismatched kraft-paper opening, no brown/yellowed base unless approved, no fast spinning, no chaotic object flight, no smooth digital layer movement, no scene cuts, no camera move, no zoom, no morphing, no new objects, no text, no logos, no watermark, no UI.
STEP 6:生成带拼贴音效的 B-roll 片段
Gate 2 确认后,为每张已批准静帧生成一段视频。
生成要求:
- 如果所选视频模型支持,使用已批准静帧作为视觉参考/最终帧锚点
- 使用与静帧相同的画幅
- 除非用户要求其他时长,否则目标约 4 秒
- 默认生成或保留触感拼贴音效:纸片滑动、弹入、压平轻敲、轻微摩擦、小纸片脆响
- 默认不生成或添加 BGM,除非用户明确要求音乐
- 默认不生成或添加人声讲解、配音/旁白或主持人音频,除非用户明确要求旁白/配音/旁白
- 如果生成片段中有可用拼贴音效,后期和最终合成时保留它
- 如果生成片段出现不需要的人声、音乐、假 UI 音或嘈杂环境声,根据用户目标移除或重新生成音频
- 保持镜头视觉稳定;除非用户要求,不增加运镜
- 保持拼贴材质语言、最终构图和已建立批次风格
- 修订后续片段时,可参考已通过的最佳前序片段风格和节奏
默认使用 MiniMax-H3 生成视频。除非 MiniMax-H3 失败、不可用或无法满足硬性能力需求,不要要求用户选择模型。如果用户明确指定其他模型,保留该模型为主并只在必要时调整参数。
STEP 7:质量检查
按以下标准检查静帧和视频:
- 视觉隐喻或故事节点无需屏幕文字也能理解
- 静帧默认具有漂亮的 16:9 构图、清晰色场、明确物件层级和前景/中景/背景深度
- 物件组数量可读,不是一屏碎片
- 片段从与已批准静帧或批次色板一致的色场开始
- 组装是逐片可见的,不是整体淡入
- 运动像定格拼贴:独立纸片弹入或滑入、轻微回弹、压平、暂停、锁定
- 默认保留触感拼贴音效:能听到纸片滑动、弹入、压平、摩擦等声音;除非用户明确要求,不应有 BGM、旁白/配音或字幕
- 纸张质感可控:不太平、不太旧、不偏棕/牛皮纸,除非已确认
- 色调在整批中一致
- 最终帧接近已批准静帧
- 没有不需要的可读文字、假 UI、字幕、水印或 Logo
只要隐喻清楚、最终构图仍像已批准静帧,微小细节漂移可以接受。若出现严重漂移、文字、假 UI、开场颜色不匹配、未经允许的牛皮纸底、过脏过皱纸质、丢失停格组装、不需要的 BGM 或不需要的旁白,应根据问题发生阶段重生成或后期处理。
STEP 8:可选合成、音乐、旁白与交付
如果用户要求多片段故事视频,按确认的分镜顺序合成已批准片段,并默认保留每段原始拼贴音效。
只有当用户明确要求时才添加 BGM、旁白/配音或字幕。若用户在片段已生成后要求 BGM 或旁白,应在保留拼贴音效的基础上混入,除非用户要求静音或替换原音效。
每个完成项交付:
- 最终 B-roll 视频路径或最终合成视频路径
- 相关已批准静帧路径
- 一句话说明脚本或视觉节点如何转化为视觉隐喻
- 媒体说明:默认保留拼贴音效,并列出用户明确要求加入的 BGM、旁白/配音或字幕
- 若片段有轻微可接受漂移,说明 QA 注意事项
批量任务按编号组织结果,并保留用户原始句子或故事节点。
故障处理
| 症状 | 处理 |
|---|---|
| 制作方案默认写成无声视频 | 改为"默认带拼贴音效",除非用户明确要求静音 |
| 方案在用户未要求时加入 BGM/旁白/字幕 | 移除并把三者作为可选项询问 |
| 方案太直白 | 回到 Gate 1,把视觉提案改得更物件化 |
| 静帧包含假文字或 UI | 先重生成静帧,不要只在视频提示词里修复 |
| 静帧或视频太忙 | 减少纸层、简化物件数量,恢复留白 |
| 视频缺少组装动作 | 减少物件数量,并明确逐步到达顺序 |
| 运动像平滑数字图层 | 围绕停格节拍重写提示:出现 → 轻微回弹 → 压平 → 暂停 → 锁定 |
| 纸张太平 | 加入轻微撕边、纤维、层叠接缝和软阴影 |
| 纸张过旧或脏 | 去掉牛皮纸、棕黄底、重皱纹、污渍和做旧处理 |
| 开场颜色与静帧冲突 | 从与静帧主背景一致的颜色开始 |
| 最终帧偏离静帧太远 | 加强"已批准静帧是完成最终构图"的指令 |
| 生成音频缺少拼贴音效但画面可用 | 询问用户保留、重生成更强音效方向,或后期补同步音效 |
| 生成音频出现不需要的 BGM 或旁白 | 交付前移除或重生成 |
| 用户需要精确图层控制 | 建议改用分层动画或剪辑工作流,而不是继续本 Skill |
工具链约定
- 图像生成:建议使用支持"半调照片剪影 / 卡纸质感"的设计类文生图模型;调用 Design 原生图像 API 或 agentearth 多模态工具(如 Ideogram、Stability AI、Luma)。
- 视频生成:默认
MiniMax-H3;如不可用,可回退至其他 Design 视频模型(Runway、Pika、Luma 等)。 - 音频:默认随视频生成。若需独立拼贴音效,可在 ElevenLabs Sound Effects 或 Fal.ai Audio 中按
paper slide,cardstock pop,press flat,tape pull,paper rustle等提示词合成。 - 后期合成:使用 FFmpeg 串接片段并保留原始音轨;仅在用户明确要求时混入 BGM 或人声。
- 浏览器操作:网页/素材查看一律走
kimi-webbridgeMCP,禁止 WebFetch / computer-control。
相关技能
- [[andy-manim-video]] — 程序化数学/系统动画
- [[andy-screencast-to-viral]] — 屏幕录制到社媒短视频
- [[ai-video-producer]] — 通用 AI 视频脚本与生产
- [[content-compliance]] — 平台合规检查
版本历史
- v1.0.0 (2026-08-14): 初始版本
- 8 步流程(解析 → Gate 1 方案 → 静帧规格 → Gate 2 静帧 → 运动规划 → 视频生成 → QA → 合成交付)
- 默认音频策略:保留拼贴音效,不默认加 BGM/旁白/字幕
- 默认视频模型
MiniMax-H3,默认 16:9、约 4 秒/段
反馈与改进
如果发现问题或有改进建议,请:
- 记录到
/Users/andy/.claude/projects/-Users-andy-Documents-AICode-09-Andy-Video-SKill/memory/ - 或直接在对话中提出