情绪 → 镜头语言四件套
R — 核心命题 (Reading)
提示词的任务不是形容画面好不好看,是交代镜头怎么观察这个画面。
「电影感」「高级感」「氛围感」都是观众看完之后的结果,模型接收不到结果,只接收得到成像条件。把情绪拆成镜头、光线、构图、色调、人物状态这些能照着摆机器的东西,画面才长得出真实感。写得越像导演在口述一张照片,成片越稳。
推论:为炫技而堆砌的提示词是负资产。 出来的图好看,但没有记忆点 —— 因为记忆点来自「人在做一个有意味的动作」,不来自参数堆得多密。
方法论来源见仓库根目录 ATTRIBUTION.md。
I — 方法论骨架 (Interpretation)
「氛围感」不是一个可执行的指令,它是结果。模型接收不到"氛围",只接收得到具体的成像条件。
真正决定一张图有没有情绪的,是四个可观测变量:
- 光位 — 光从哪个方向来。逆光/侧逆光会勾出轮廓、压暗面部、让空气可见(灰尘、发丝、雾),这是"电影感"最大的单一来源。
- 景深 — 什么清楚、什么虚。浅景深把注意力钉在主体上,前景遮挡(虚化的枝叶/人的后脑/玻璃)制造"偷看"的窥视感。
- 机位 — 相机站在哪、朝哪看。仰拍给崇高与压迫,俯拍给渺小与被审视,平视给平等与日常。一个镜头只用一个主运镜,多了画面失控。
- 人物状态 — 人在做一个什么动作。闭眼、回眸、额头相触、直视镜头——必须是有意味的动作,不能是"站在那儿好看"。
写提示词时,把这四项各写一句具体描述,形容词一个不要。写完自问:这段话能不能让一个摄影师照着摆出机器? 能,就合格。
情绪不同,只是四个变量的取值不同,框架不变。
A1 — 来源中的应用 (Past Application)
案例 1: S4 参考片的五帧实测
- 问题: 一条 28 秒的唯美情侣情绪片,如何做到每一帧都"有感觉"
- 方法论的使用: 逐帧拆解四件套取值
帧 光位 景深 机位 人物状态 01s 逆光,湖面反光过曝 浅,左侧水面虚化 平视特写 闭眼,下巴埋进红围巾 07s 树叶间隙斑驳逆光 + 光晕 浅 平视近景 回眸,目光斜向下 14s 单侧窗光成束,大面积暗部 中 平视中景,对称构图 半躺,手持香烟 21s 仰拍逆光,天空过曝 浅 极低机位仰拍 两人额头相触,闭眼 27s 逆光,草地虚化 浅,前景人物后脑遮挡 平视近景 直视镜头 - 结论: 逆光 5/5、浅景深 5/5、明确情绪动作 5/5、非水平机位或前景遮挡 4/5
- 结果: 没有一帧是"人站在那儿好看"。情绪来自"人在做一个有意味的动作 + 光从对面来"
案例 2: 苦布丁的反面教训
- 问题: 为炫技写提示词,画面好看但观众记不住
- 方法论的使用: 他的判断是——画面服务故事,不是故事服务画面
- 结论: 好看≠有记忆点
- 结果: 他把精力放回故事与镜头隐喻(结局的莲花),而非堆砌视觉词
A2 — 触发场景 (Future Trigger) ★
用户会在什么情境下需要这个 skill?
- 要写生图提示词,但脑子里只有一个情绪词("想要那种很治愈的感觉")
- 已经生成了一批图,觉得"平""没感觉""像摆拍",但说不出该改什么
- 要把一个已定的情绪/品类(古墓惊悚、游戏燃系、动漫治愈)落成一组具体镜头
- 在写分镜表的「画面提示词」列,卡在怎么描述
语言信号
- "想要氛围感 / 电影感 / 高级感 / 质感"
- "怎么写提示词才有感觉"
- "出来的图很平 / 很普通 / 像证件照"
- "这个镜头我想要那种……(说不下去)"
- "cinematic / atmospheric / moody"
与相邻 skill 的区分(定稿)
- 与
lock-character-reference的区别:本 skill 依赖那个 skill——四件套里的"人物状态"默认角色形象已经稳定锁定;角色形象还没锁死或反复跑不稳,先转lock-character-reference,不要在这一步硬写提示词 - 与
shot-breakdown(镜头拆解)的区别:本 skill 管生成前怎么描述,那个管生成后怎么筛选和修正;本 skill 产出的提示词是shot-breakdown批量生成的输入 - 与
material-driven-storyboard(素材反推分镜)的区别:本 skill 管单个镜头内部怎么写,那个管整片从哪起手。二者是composes-with而非上下游依赖:四件套里"人物状态"这一项在本地条件下不是凭空写出来的,而是要先看material-driven-storyboard盘点出的驱动视频库里有哪些具体动作瞬间,再把它翻译成人物状态描述——机位/光位/景深三项可以纯靠提示词正推,唯独人物状态要反过来靠素材反推 - 与
rhythm-density(节奏疏密)的区别:本 skill 管一镜画面,那个管镜与镜之间的时长排布
E — 可执行步骤 (Execution)
提取情绪关键词并追问落点
- 从用户的话里找出情绪词(治愈/压抑/燃/惊悚/暧昧)
- 追问一句:这个情绪发生在什么时刻?(不是什么场景——要的是时刻,如"她刚意识到对方要走")
- 完成标准:得到一个具体时刻,而非一个氛围形容词
定光位
- 默认优先 逆光/侧逆光(情绪片最高频,S4 实测 5/5)
- 治愈 → 顶光柔光/窗光;惊悚 → 低位光/侧硬光 + 大面积暗部;燃 → 侧逆 + 强对比边缘光
- 写成一句可执行描述:「夕阳逆光从人物斜后方射入,面部大部分在阴影里,发丝边缘透出金色轮廓光」
- 完成标准:句子里有光源方向 + 光质 + 面部明暗分布
定景深与前景
- 默认浅景深;判断要不要加前景遮挡(想要窥视感/纵深就加)
- 写成:「浅景深,背景草地完全虚化;前景有一个虚化的人物后脑做遮挡」
- 完成标准:明确了什么清楚、什么虚、有无前景
定机位
- 平视=日常平等;仰拍=崇高/压迫;俯拍=渺小/被审视;极低机位=戏剧化
- 一个镜头只给一个主运镜(固定/缓推/缓拉/横移/上摇,择一)
- 完成标准:机位高度 + 视角方向 + 唯一运镜都已写明
定人物状态
- 必须是动作或神态,不是外貌描述
- 可用清单:闭眼、回眸、低头、直视镜头、额头相触、手抵住嘴、屏息、转身欲走
- 完成标准:读这句话能想象出人正在做什么,而不只是长什么样
组装并自检
- 按「机位 → 光位 → 景深/前景 → 人物状态 → 环境与色调」顺序写成一段中文
- 自检问句:这段话能不能让一个摄影师照着摆出机器?
- 删除检查:氛围感/电影感/高级感/唯美/绝美/大片感 —— 出现即删,用具体描述替换
- 完成标准:全段无空泛形容词,四件套齐全
B — 边界 (Boundary) ★
不要在以下情况使用此 skill
- 用户已经给出了具体机位光位的提示词——不需要翻译,直接用
- 纯信息类/图表类出图(示意图、UI、产品图)——四件套是叙事影像的语言,不适用
- 用户要的是风格而非情绪(如"赛博朋克风""吉卜力风")——那是风格词与画风模型的问题,本 skill 管的是成像条件
来源中警告的失败模式
- 堆形容词("电影感/高级感/氛围感")——模型接收不到抽象概念,只接收成像条件
- 为炫技写提示词(S1 [17:40])——画面好看但没记忆点,本末倒置
- 人物只有外貌没有动作——出来就是"站在那儿好看"的摆拍感
- 一个镜头堆多个运镜——画面失控
作者的盲点 / 局限
- S4 的四件套统计样本只有 5 帧、单一品类(唯美情侣)。迁移到惊悚/燃系时取值需要重新验证,框架可复用但默认值(如"优先逆光")不一定成立
- S1 与 S4 均基于云端模型(即梦/可灵/Nano Banana/Image2)。本地 z-image 对复杂光位描述的响应可能弱于云端大模型,描述要更短更硬,别写长句
容易混淆的邻近方法论
- 与"提示词工程"(加权、负向词、LoRA 触发词)不是一回事——那是工具层,本 skill 是内容层
- 与"构图法则"(三分法、对称、引导线)有交叉但不等同——构图是景深/机位的下位细节
相关 skills
- depends-on:
lock-character-reference(四件套的"人物状态"假设角色已锁定;未锁定时描述再准确也没有一致的角色可套) - contrasts-with: 无
- composes-with:
material-driven-storyboard(本地条件下"人物状态"这一项需要那个 skill 盘点出的驱动视频素材做支撑,不能纯靠想象正推)
审计信息
- 验证通过: V1 ✓ (S1+S4 双源, S4 内 5 帧独立采样) / V2 ✓ (可外推古墓惊悚、动漫治愈等未讨论品类) / V3 ✓ (与"堆形容词"的常识做法相反)
- 测试通过率: 待阶段 4
- 蒸馏时间: 2026-08-01