剧本杀模拟评测系统(Murder Mystery Simulation & Evaluation)
概述
本技能通过多Agent协作模拟一场完整的剧本杀游戏,并对剧本质量进行专业评测。每个Agent拥有独立的人格参数、情绪易感度和社交偏好,使模拟尽可能贴近真实玩家体验。
🎭 Agent实例系统(v2)
每个Agent不再是一次性的参数组合,而是有专属名字、有持久记忆、可跨场景复用的数字演员:
- Agent花名册:
assets/agents/AGENT_ROSTER.md— 所有实例的索引和追踪规范 - 每个Agent实例:
assets/agents/{角色文件名}.yaml— 独立的人格基因、状态日志、思维演变、关系快照 - 状态追踪:每轮结束后更新
state_log,记录情绪波动、怀疑变化、被影响记录 - 思维演变:
thought_evolution追踪信念锚点和转折点,记录每次重大认知变化 - 可复用设计:Agent名和人格基因独立于角色手册,换剧本只需替换角色信息
当前可用Agent实例:
| Agent名 | Codename | 原型 | 风格 |
|---|---|---|---|
| 墨隐 Mo Yin | QUILL | 隐忍的智者 | 逻辑锚定型 |
| 炽锋 Chi Feng | BLADE | 忠诚的战士 | 直觉爆发型 |
| 摇光 Yao Guang | CROWN | 被操控的权力者 | 社交导向型 |
| 蚀心 Shi Xin | VENOM | 伪装的操控者 | 操控大师型 |
| 铁戟 Tie Ji | ANVIL | 粗犷的守护者 | 暴风型 |
| 灰弦 Hui Xian | HAZE | 悔恨的帮凶 | 谨慎防守型 |
| 拾墨 Shi Mo | INK | 沉默的证人 | 信息囤积型 |
| 棋落 Qi Luo | GAMBIT | 暗处的博弈者 | 暗线操盘型 |
何时使用
- 用户提供剧本杀材料(角色手册、DM手册、线索卡等),要求模拟打本
- 用户要求评测一个剧本杀的质量
- 用户想测试剧本的信息设计、推理体验、角色平衡性
- 用户想了解剧本的社工空间和情绪驱动效果
工作流程
本技能分为6个阶段,严格按顺序执行。
阶段1:材料收集与解析
收集用户提供的剧本材料。最低要求:角色手册 + DM手册/真相。
执行步骤:
- 确认收到的材料类型(角色手册、DM手册、线索卡、地图、特殊机制)
- 提取关键信息:
- 角色数量和名称
- 每个角色的已知信息、秘密、目标
- 真相时间线
- 凶手身份
- 关键线索及其分布
- 游戏流程和特殊规则
- 构建"世界事实表":所有确定性事实的清单,用于后续验证Agent不会信息越界
- 如材料不完整,列出缺失项并询问用户是否可以合理推断补全
阶段2:Agent配置
为每个角色分配模拟玩家Agent,配置人格参数。
参考文件:references/system_architecture.md — 第2节"Agent人格系统"和第6节"参数预设模板"
执行步骤:
- 根据每个角色的性格特征,选择基础玩家类型(logical / social / newbie / veteran / immersive)
- 基于角色手册内容微调参数:
- 凶手角色:提高 persuasion_skill 和 charisma,降低 guilt_susceptibility
- 与死者关系亲密的角色:提高 empathy_susceptibility
- 性格设定为强势的角色:提高 assertiveness 和 contrarian
- 性格设定为软弱/犹豫的角色:提高 conformity,降低 assertiveness
- 生成角色参数配置表,供用户审核确认(参考
assets/character_param_template.yaml) - 初始化关系矩阵:基于角色手册中的角色关系设定初始信任度/好感度
关键原则:
- 参数配置应多样化——不要让8个Agent都是理性型,那会失去模拟意义
- 至少包含1个高从众型、1个高对抗型、1个高情绪敏感型
- 凶手的参数应让TA有一定操作空间,但不应过于逆天
阶段3:模拟执行
按标准剧本杀流程运行模拟。
参考文件:
references/system_architecture.md— 第3节"模拟流程"references/agent_prompts.md— 所有Agent提示词模板
标准流程
第一阶段:开场(1轮)
为每个Agent生成开场自我介绍。每个Agent只能使用自己角色手册中的公开信息。
第二阶段:自由讨论(2-3轮)
每轮按以下方式执行:
- 确定发言顺序(可随机或按角色设定的assertiveness排序)
- 为每个Agent生成发言,严格使用
references/agent_prompts.md中的系统提示词模板 - 每个Agent的输出必须包含:发言内容、内心独白、策略标记、怀疑排名、情绪状态
- 每个Agent发言后,更新所有其他Agent的关系矩阵
说服力计算:当Agent A的发言试图影响其他Agent时,按 references/system_architecture.md 第2.3节的公式计算影响力。
第三阶段:搜证(1-2轮)
- 根据剧本搜证规则分配线索
- 每个Agent决定是否公开获得的线索(基于目标和策略)
- 更新每个Agent的已知信息集
第四阶段:集中讨论(2-3轮)
与自由讨论类似,但节奏更紧张。这是情绪策略的主要使用阶段。
- 鼓励Agent使用
references/system_architecture.md第2.4节中的情绪煽动策略 - 联盟/阵营应在此阶段自然形成
第五阶段:投票(1轮)
使用 references/agent_prompts.md 第5节的投票阶段提示。每个Agent输出最终陈述、投票对象、理由、信心度。
第六阶段:复盘
揭示真相,每个Agent回顾自己的推理链,标记正确推理和被误导的时刻。
模拟格式规范
每轮输出格式(含Agent状态追踪):
## 第X轮 — [阶段名称]
### [Agent名]([角色名]) 发言
> "[实际说出的话]"
<details>
<summary>🧠 [Agent名] 内心独白</summary>
- **真实想法**:...
- **策略**:[信息分享/质疑/辩护/情绪策略/试探/沉默观察]
- **怀疑排名**:1. XXX(原因) 2. XXX(原因)
- **情绪状态**:[平静/紧张/愤怒/困惑/自信/恐惧/得意]
- **情绪波动**:[相比上轮的变化方向和原因]
- **被影响记录**:[是否被上一轮某人的发言影响,具体影响]
- **信念变化**:[thought_evolution中的malleable_beliefs是否有变动]
- **认知负荷**:[0~1,信息压力值]
</details>
---
关键规则:每轮结束后,必须更新每个Agent的 state_log 和 thought_evolution.turning_points(如有变化)。状态追踪是评测分析的数据基础,不可省略。
阶段4:数据收集
模拟完成后,整理以下数据:
- 投票结果汇总:谁投了谁,投票正确率
- 推理链追踪:每个Agent的怀疑目标如何随时间变化
- 影响力事件表:哪些发言成功影响了其他Agent的判断
- 情绪策略使用记录:哪些情绪策略被使用,成功率如何
- 信息流转图:关键信息如何在Agent之间传播
- 关系矩阵变化轨迹:信任度/好感度随轮次的变化
阶段5:评测分析
参考文件:references/system_architecture.md — 第4节"评测维度"
对模拟数据进行5个维度的评测:
- 信息设计(25%):线索均衡度、推理可达性、信息冗余度、信息遮蔽度、空气人检测
- 推理体验(25%):逻辑链完整度、误导质量、啊哈时刻、推理难度曲线
- 角色体验(20%):故事独立性、互动驱动力、秘密有趣度、凶手体验
- 节奏(15%):信息释放节奏、高潮设计、中期参与度、结局满足感
- 社工空间(15%):话术操作空间、带节奏脆弱度、联盟形成自然度、情绪驱动占比
每个维度给出0-100分数,并用实例佐证。
总分 = 信息设计×0.25 + 推理体验×0.25 + 角色体验×0.20 + 节奏×0.15 + 社工空间×0.15
评级:S(90+)/ A(80-89)/ B(70-79)/ C(60-69)/ D(<60)
阶段6:报告生成
参考文件:assets/report_template.md — 评测报告模板
生成完整的Markdown评测报告,包含:
- 总评与评级
- 各维度详细分析(引用模拟中的具体事件)
- 每个角色的体验评分
- 关键时刻回顾
- 分优先级的改进建议
- 附录:完整模拟记录 + Agent参数 + 关系变化
报告保存为 {script_name}_评测报告.md。
特殊场景处理
角色数量不是8人
- 少于8人:按实际角色数量配置Agent
- 多于8人:优先模拟核心角色(凶手+与真相直接相关的角色),其余角色简化处理
用户只想评测不想看完整模拟
跳过详细的逐轮输出,直接生成数据汇总和评测报告。在模拟执行阶段使用压缩格式:每轮仅输出关键发言和决策点。
用户想调整参数重新模拟
支持修改Agent参数后重新运行。对比两次模拟的结果差异,分析参数变化的影响。
用户提供的是英文剧本
Agent发言使用中文,但角色名和专有名词保留原文。
资源清单
| 资源 | 路径 | 用途 |
|---|---|---|
| 系统架构文档 | references/system_architecture.md |
Agent参数体系、模拟流程、评测维度定义 |
| Agent提示词模板 | references/agent_prompts.md |
所有Agent的系统提示词模板 |
| 评测报告模板 | assets/report_template.md |
最终输出报告的Markdown模板 |
| 角色参数模板 | assets/character_param_template.yaml |
用户可填写的参数配置文件 |
| Agent花名册 | assets/agents/AGENT_ROSTER.md |
Agent实例索引、状态追踪规范 |
| 墨隐实例 | assets/agents/feng_buwen.yaml |
风不闻 — 逻辑锚定型 |
| 炽锋实例 | assets/agents/zhenxin.yaml |
真心 — 直觉爆发型 |
| 摇光实例 | assets/agents/xuanyuan_li.yaml |
轩辕离 — 社交导向型 |
| 蚀心实例 | assets/agents/jia_zhong.yaml |
贾钟 — 操控大师型 |
| 铁戟实例 | assets/agents/mu_tiancheng.yaml |
沐天成 — 暴风型(含生命周期) |
| 灰弦实例 | assets/agents/xiao_cheng.yaml |
萧澄 — 谨慎防守型(含叛变追踪) |
| 拾墨实例 | assets/agents/yunxi.yaml |
云溪 — 信息囤积型(含特殊能力) |
| 棋落实例 | assets/agents/murong_shuang.yaml |
慕容霜 — 暗线操盘型(含隐藏资源) |