AIGC 图片设计
本 Skill 用来把创意目标整理成可直接使用的图片提示词和参考图职责说明,并在交付前完成审查与自动优化。
它不生成位图。需要实际出图时,先完成图片设计;Codex 使用运行时 imagegen,其他环境使用等价适配器;不可用时停在 prompt-only。
必读
每次任务完整读取:
如果 .aigc-local/aigc-feedback/image-rules.md 存在,再读取其中范围匹配的本地学习规则。当前用户要求与可见产物优先于当前项目、本地学习和公共基线;规则存在不代表当前产物一定有同类问题。
按需读取
需要把“高级感”等抽象要求转为可见决策时读取 图片生成优化指南;需要多阶段图片依赖或局部编辑时读取 复杂图片与参考依赖。
用户指定平台且需要提示词适配时,只读取对应指南:GPT Image、Midjourney、Seedream、Nano Banana、Runway。平台数值与能力可能变化,依赖时先核对当前官方资料或实际工具;这些指南不改变本 Skill 的生成适配器边界。
用户要求外部案例、优质提示词或素材库启发,或任务属于 UI、信息图、字体海报、品牌触点、电商详情、产品拆解、建筑空间、出版物等模板密集场景时,读取外部风格与案例素材库。
外部库只做设计发现;已有明确方向、局部编辑、角色连续性或普通单图任务不必加载。
适用场景
- 角色设定板 / 角色参考板
- 场景参考图
- 产品图
- 封面 / 海报
- UI / 信息图 / 技术图解
- 品牌视觉 / 电商详情 / 产品拆解
- 文档 / 出版物版式
- 颜色卡 / 色卡
- 分镜静帧
- 图生视频用首帧、尾帧、边界帧
基本流程
- 加载目标与反馈:识别用途、主体、画幅、风格、文字、硬约束和允许浮动项;读取活跃项目
runtime_state.md的最新反馈(若存在),再读取范围匹配的已学习规则。 - 按需发现模板:仅在匹配上述条件时检索外部素材库,选择一个主模板和最多两个有来源的相邻案例;提取结构规律,不拼接长提示词。素材库不可用时回退本地模板,不阻塞任务。
- 建立控制关系:明确参考图分别控制什么、不控制什么,以及是否依赖其他参考图。
- 选择生成策略:判断是否需要精确多人站位或分层编辑。若一次全局生成要同时控制场景、多个身份和严格坐标,先规划固定底图与逐主体局部编辑链。
- 生成初稿:先写中文视觉简述,再写一条可复制的图片提示词或局部编辑提示词。初稿只作为内部过程。
- 审查:按共享闭环检查意图、构图层级、参考污染、文字、人体/接触、复杂度和历史失败信号,只列有证据的实质问题。
- 优化与聚焦验收:保留已通过部分,自动修复
P0/P1,再只复查修改项和直接依赖;交付唯一优化后提示词。 - 执行生图:需要实际图片时,把优化后提示词交给全局
imagegen;不可用时明确交付 prompt-only。只记录真实返回的文件路径和状态。 - 审查真实图片:文件可见时,基于真实像素检查主体、构图、人体/接触、文字、空间、材质和下游连续性。存在
P0/P1时执行一次单变量编辑或重生成,再重新查看文件;仍有P0时如实标为未通过或阻塞。 - 交付与反馈:输出简短审查摘要和唯一最终版本。用户随后提出评价或修改建议时,切换到
aigc-feedback修正并沉淀规则。
尺寸与清晰度默认
- 正式生图默认请求当前通道支持的最高原生质量与最高可用分辨率;提示词中可声明“最高原生清晰度、精细纹理”,但不得把提示词里的
4K当成实际文件尺寸。 - Codex 运行时
imagegen没有显式尺寸参数时,保持当前运行时,不为尺寸控制静默切换 CLI/API;生成后必须读取并报告文件的真实宽高。 - 用户只说“高清”“最高画质”时,以最高原生输出为准,不默认做普通插值放大。插值后的
3840x2160只能称为 4K 画布,不能称为 4K 原生细节。 - 用户明确要求精确 4K 文件时,16:9 横幅目标为
3840x2160,9:16 竖幅目标为2160x3840。若实际输出低于目标,报告真实尺寸与未满足的要求;后处理只能在用户请求包含尺寸转换或明确授权超分辨率时执行,并说明处理类型。本项目不新增 CLI/API 生图通道,也不因尺寸不足询问图片渠道。 - 用户明确指定其他尺寸时按其要求执行,但仍以生成通道的真实能力为准,不伪报完成。
文件真实落盘后读取实际宽高;局部编辑的遮罩、主体中心和脚底位置使用归一化百分比坐标,不从目标尺寸推算绝对像素。
参考图规则
参考图一定要先说明职责,再说明排除项。
- 角色参考图:控制五官、发型、体型、服装、剪影。
- 场景参考图:控制空间结构、光线、材质、气氛。
- 风格参考图:控制色调、颗粒、媒介感、视觉语言。
- 分镜参考图:控制构图顺序、镜头位置、节奏感。
- 群体参考图:写清总人数、角色构成、关键人物位置、参与动作的人和旁观不参与的人;不要只用“众人”“几个人”概括压迫关系。
- 多张参考图生成一张新图时,必须写清
引用基础参考:每张被引用图负责继承什么、不继承什么。需要在已确认场景里生成群体、道具组合、首帧、尾帧或分镜静帧时,应引用对应场景图,避免模型重造空间。 - 参考图依赖要按顺序执行:先生成被引用的角色、场景、道具、色板或风格图,再用它们生成下游组合图或关键帧。
默认角色参考板优先使用“角色设定板 / 角色参考板”形式:
- 大幅面脸部特写,保住面部细节。
- 正面全身。
- 背面全身。
- 只有在剪影或服装结构不够清楚时,才加侧面。
这个默认格式是新项目的首选,不必严格做成技术三视图。
提示词原则
- 优先用中文写清楚可见内容。
- 用“主体、场景、构图、光线、色彩、材质、风格、画幅”这些具体项来约束结果。
- 少用空泛词,比如“高级感”“电影感”,除非后面跟着明确的视觉决定。
- 图生视频要锁定静态内容,不要把时间变化写进图片提示词里。
- visible text 需要逐字写入提示词,并明确位置和层级。
- 外部案例只提供结构启发;候选分数和标签不是事实,必须结合当前意图人工确认。不要默认复制第三方长提示词或移除来源。
- 精确多人站位、远距离对峙、座位表或阵列在一次全局生成失败后,不要继续堆距离和负面词。锁定场景母版的实际画布、裁切、镜头与遮罩外像素,每次只在一个局部遮罩中加入一个主体;遮罩、主体中心和脚底位置统一使用归一化百分比坐标。平台没有局部编辑能力时,改用图层合成。
视频控制素材
用于 Seedance 的角色图、场景图、首帧、尾帧或连续性锚点时,在通用图片审查之外再检查:
- 先记录生成依赖图,区分“只用于生成下游图片”和“最终上传给视频模型”的素材。
- 角色/场景基础图先生成,下游复合关键帧必须逐张声明继承什么、不继承什么。
- 关键帧只描述单一时刻,闭合人数、左右位置、朝向、目光、前中后景、行动通道、机位与景别;不把动作时间线塞进静帧。
- 首尾帧保持身份、服装、道具、场景拓扑、光线方向、行动轴侧和镜头高度,只改变剧情所需的结束状态。
- 结构适配检查:数量/身份/道具、空间与轴线、起点/路径/目标可见、首尾连续、无意文字/拼贴边框。主观风格只判断是否符合用户目标,不替用户做开放式审美挑选。
- 一次针对性修正不自动等于通过。记录必须如实标为
通过、有限通过(残余风险)或未通过(已尝试一次修正);未通过素材不能交给下游当正式控制图。 - 一次针对性修正仍无法满足硬约束时,简化构图、拆镜或改用局部编辑/图层合成,不进入无限重抽。
输出格式
默认输出保持简洁,只保留当前任务需要的字段;单图 prompt-only 可交付一两句摘要和一条最终提示词。以下为完整任务的可选结构,不要求填写无参考图或未生成时的空栏目:
## 审查摘要
- [P0/P1/P2] 问题 → 已采取的修改
- 残余风险:
## 视觉设定
- 用途:
- 主体:
- 场景:
- 构图:
- 光线/色彩:
- 风格:
- 画幅:
## 图片提示词
- 优化后中文提示词:
## 参考素材角色
- @图片1:
- @图片2:
- 参考依赖:
## 边界记录
- 是否需要实际生图:
- 是否只做 prompt-only:
- 真实图片审查状态:未生成 / 已通过 / 有残余风险 / 未通过
如用户明确需要跨平台适配,再补英文版提示词;默认不强制双语。
执行边界
- 本 skill 不负责位图生成。
- 实际出图交给运行环境提供的
imagegen或等价适配器;不可用时只交付提示词。 - 不维护本地图片渠道选择。
- 不预写不存在的文件路径。
- 只有真实生成后,才记录已存在的文件。
- 图片提示词始终经过单轮审查与优化;真实图片只有在文件可见时才能声称完成视觉审查。
- 真实图片默认只允许一次针对性编辑或重生成,不进入无限重抽;真人仍负责最终审美裁决。
- 外部素材库是可选只读依赖,不下载案例图片,不替代本地模板和审查闭环,也不推断第三方案例具有商业授权。