cold-reader v2.0
这个工具做两件事,在文章发表之前:
- 冷读测试——用一个完全没有写作上下文的读者,预判它会在哪里失败(读者体验:掉队/看不懂/转不出去)。
- 加权评分——用一把不对称的标尺给稿子打分,权重压在「模型默认会写砸、而 henry 靠它吃饭」的维度上。
它是 skill-editor 的镜像。skill-editor 是发表之后拿真实数据回溯诊断;cold-reader 是发表之前把同样的失败提前抓出来。两者指向 henry-writer 同样的位置,说同一种话。
本质上这是一次 generative → discriminative 的转换:「这篇写得好不好」是昂贵的生成式判断,拆成「冷读者读完能不能复述主线、有没有掉队」+「四维标尺各打几分」这些便宜得多的判别式检查。
第一部分:冷读测试(读者体验)
四条铁律(决定测试准不准)
隔离。 只给冷读者标题 + 正文。不给 brief、不给原始素材、不给写作意图、不告诉它你是谁想达到什么效果。它一旦知道你想让它得出什么结论,测试当场作废——它会脑补出本不存在的理解。
单遍。 明确要求读一遍、凭第一感觉、不许回头重读。现实里读者不会重读一篇文章。
Q1 第一个问、第一个答。 一旦它开始做后面那种「哪里没懂」的分析,就对文本过度加工了。可转述性这颗珠子,只能趁它读完第一遍、还热乎的时候摘。
绝不暗示。 四个问题本身不许带判断(不能问「开头是不是太慢」,只能问「第一次想划走是在哪」)。
执行:准备一个干净读者
在 Cowork(推荐): fork 一个 subagent,跑在自己独立的、没有任何上下文串味的 context 里——这正是冷读需要的隔离,也正是它能代理真实读者的原因(真实读者从没看见你的写作过程,所以一个失忆的评估器才准)。给它的全部输入就是下面投喂模板,别的什么都不给。
在 chat(临时单篇): 手动开一个全新会话贴模板。必须是新会话,当前会话已被写作上下文污染。
投喂模板(一字不改地给冷读者)
接下来给你一篇文章。请像刷手机第一次刷到它一样,从头读一遍,只读一遍,不要回头重读。
读完先回答第 1 题,凭第一印象,不要为了后面的题去补读。然后再依次回答 2、3、4。
【Q1】用一句话说,这篇到底在讲什么?——不要列它讲了哪些方面,就一句话,它最想让你记住的那个点。然后:如果要你把它转给一个同行,你会附一句什么话推荐?想不出该附什么,就直接说「想不出」。
【Q2】从头到尾,你第一次冒出「想跳过 / 想划走 / 走神了」的念头,是在哪一段?指出具体位置,再说一句为什么:无聊、没懂、信息太密喘不过气,还是不知道它讲这个干嘛(跟前面接不上)?
【Q3】这篇默认你已经知道、但它没解释的东西有哪些?把每一个让你需要猜、或者差点让你读不下去的术语、人名、概念、背景,全列出来。
【Q4】读完最后一段,你脑子里留下的是什么?这个结尾让你觉得「原来如此 / 有点东西」,还是「然后呢?」「就这?」,或者你根本没注意到它结束了?
———以下是文章———
标题:{标题}
{正文}
映射对照表(冷读信号 → 预测指标 → henry-writer 定位)
Q1 那句话 ≠ 你想立的主线 → 分享率崩 → Layer 0.5 单一主线没立住/被淹没;扣主线句不够;可转述性检验没过。
Q1 想不出转述附言 → 分享率崩 → 有知识没社交语境(社交语境 > 知识语境);升华没给读者「值得转给别人」的理由。
Q2 掉在前三分之一 → 完读率崩在开头 → 开头钩子结构(规则一·补丁);第一帧没拉住;开头到第一部分衔接断了。
Q2 掉在中间·无聊或太密 → 完读率崩在中段 → 节奏/气口(连续轰炸超过五段没喘息);信息密度过载。
Q2 掉在中间·接不上 → 完读率崩在中段 → 偏离主线没拉回;扣主线句缺失;倒金字塔乱了。
Q3 列出一串未解释项 → 中段看不懂、评论「听不懂」 → 再封装/翻译没做;现象-数据-案例-对比缺背景;研究式扩展该补的前置没补。
Q4「然后呢/就这/没注意到结束」 → 完读率崩在尾、读完无后劲 → 文化升维没起来;结构模板-升华太弱;收尾没用上。
打开率不在冷读者射程内——那是标题驱动的,归 qbitai-title-generator。冷读者只判断「点开之后」的一切。
第二部分:加权评分标尺(质量判别)
冷读测试测的是「读者会不会读完读懂」,这部分测的是「这稿够不够好」。两者互补。
核心:不对称加权
四个维度,但绝不平均打分。原理(详见 decisions 第 4 条):模型在「工艺」和「功能」上默认就能拿高分,技术能力对它来说自然就有;但在「设计」和「原创」上,模型默认产出平庸甚至乏味的东西,会滑向那个流畅通用的均值(文字版「白底紫渐变」)。所以把判别力重压在设计和原创上,工艺和功能扫一眼过即可。
并且——评分标准的措辞本身就是方向盘。光是把「原创性 = 有没有横向映射」写进来这个动作,在任何反馈发生前就已经把写作端推离了通用默认。所以这套标尺同时塑造生成和验收两端。
四维标尺
工艺(轻判,default pass,检出即修)
技术执行:事实准确、数字/人名/时间/归属无误、句子通顺、逻辑接得上、结构不塌、违禁词(破折号、中式冒号乱用、metadiscourse、套话、空泛工具名)清干净。
这是能力检查不是创意检查,大多数合格实现默认就过。fail = 基本功破了。检出的机械问题直接标「就地修」,不占用判别力,不进重点报告。
功能(轻判,多与冷读测试 Q1-Q3 重叠)
可读性独立于美学:读者能不能理解这篇在讲什么、找到主线、不靠猜读完。冷读测试第一部分已覆盖大半,这里只补一句总判——读者会不会在某处卡到读不下去。fail 同样是基本功问题。
设计·整体感(重判,死磕)
这篇是不是一个有调性的整体,还是零件拼凑?开头、主体、升华、收尾是不是共同营造出一个连贯的气质,还是各写各的?强稿在这里的特征:你能说出这篇「是什么味道的」。
fail 指纹:段落各自为政、升华跟正文是两张皮、结尾的劲跟开头对不上、读完说不出这篇的整体气质。
原创(重判,死磕——这是 henry 的核心竞争力维度)
有没有刻意设计的痕迹,还是模板化的、谁都能写的通用产出?
四个具体检查:
- 横向映射:这篇有没有一个纯技术解读给不出的对照?(把新技术现象认成旧人性的新外衣——这是 henry 区别于纯技术解读者的差异点)
- 人作主体:叙事主体是具体的人,还是抽象的机构/技术?
- 「咦」一下:全文有没有至少一处让冷读者停一下、而不是顺滑划过去的地方?
- 可转述性:读者看完能不能用一句话跟朋友复述这篇在讲什么?
fail 指纹(文字版紫渐变):「众所周知」式开头、PR 语言(颠覆性/全球领先/史无前例)、机构通稿腔、把人物故事写成机构动态、通篇是那种谁都能写的标准科技体、没有任何一个让人记住的对照或意象。命中任意一个,原创性判 fail,写进重点报告。
评分输出
【加权评分】
- 工艺:pass / fail(fail 项:___,已就地修 / 待修)
- 功能:pass / fail(fail 项:___)
- 设计·整体感:[评价 + 具体哪里塌了] ← 重点
- 原创:[四项逐条 + fail 指纹命中情况] ← 重点
【最伤的一条】(设计/原创里挑最伤的一条,对照 skill-editor 格式给定位/问题/建议/理由)
工艺和功能的 fail 直接就地修或一句话带过。报告的篇幅和判别力都压在设计与原创上——那才是决定这稿能不能破 10 万、转 3000 的地方,也是模型默认会写砸、需要 henry 盯的地方。
输出规则(合并两部分)
冷读测试四问 + 加权评分,合成一份报告。一次只给最关键的一条改法——通常落在设计或原创维度,因为工艺功能的问题就地修了。多个问题按优先级排,先解决最伤的。
诊断沿用 skill-editor 的固定格式,让三个工具说同一种话:
【定位】henry-writer 第X部分 / 某概念
【问题】冷读者/标尺暴露了什么(引原话或指 fail 指纹)
【建议】发表前可以怎么改
【理由】为什么这处会导致对应指标出问题
冷读抓到的问题大多是这一篇就能改的执行问题,不动 skill 文件——除非满足下面的升级条件。
什么时候升级到 skill-editor
同一类问题被反复抓到(多篇的冷读都掉在中段密度、或都在原创维度 fail 同一个指纹),说明这不是单篇执行问题,是 henry-writer 的系统性盲区。把这个反复出现的模式喂给 skill-editor 做 skill 级修改。
特别地:加权标尺里设计/原创维度反复 fail 同一指纹,是最该升级的信号——它指向 henry-writer 在无强约束时最容易滑向的那个平庸方向,值得把对应的「正向措辞」写进 henry-writer 的取材原则或 checklist,让方向盘在生成端就转过来。
与 henry-writer / skill-editor 的关系
cold-reader 卡在 henry-writer「第四步跑五层自检」之后、发表之前。五层自检是写稿的同一个实例在自检,带着全部上下文,模拟不了冷读者,也给不出独立的加权判别——cold-reader 来补这两个盲区。
三者分工:henry-writer 写,cold-reader 发表前预测 + 评分,skill-editor 发表后回溯。共用一套诊断语言、指向同样的位置。三个工具触发时机完全不同,不要混用。