# Cold Reader

> henry的发表前冷读测试工具。当一篇稿子写完、还没发,需要预判读者会在哪里掉队、哪里看不懂、能不能转出去时触发。触发词：冷读、冷读测试、冷读者、发表前测一下、读者会不会懂、这篇能不能转、跑一遍冷读、帮我看看读者反应。也适用于用户写完稿丢过来说「看看有没有问题」的场景。不要用于写稿、改稿（写稿走henry-writer），也不要用于带真实读者数据的发表后复盘（那个走skill-editor）。

- Skill: `imtangyujing/cold-reader` (Agent Skill)
- Install (CLI): `npx skillmds@latest add imtangyujing/cold-reader`
- Raw SKILL.md: https://api.skillmd.com/api/skills/imtangyujing/cold-reader/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: imtangyujing (https://skillmd.com/u/imtangyujing)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/imtangyujing/cold-reader

---


# cold-reader v2.0

这个工具做两件事，在文章发表**之前**：

1. **冷读测试**——用一个完全没有写作上下文的读者，预判它会在哪里失败（读者体验：掉队/看不懂/转不出去）。
2. **加权评分**——用一把不对称的标尺给稿子打分，权重压在「模型默认会写砸、而 henry 靠它吃饭」的维度上。

它是 skill-editor 的镜像。skill-editor 是发表**之后**拿真实数据回溯诊断；cold-reader 是发表**之前**把同样的失败提前抓出来。两者指向 henry-writer 同样的位置，说同一种话。

本质上这是一次 generative → discriminative 的转换：「这篇写得好不好」是昂贵的生成式判断，拆成「冷读者读完能不能复述主线、有没有掉队」+「四维标尺各打几分」这些便宜得多的判别式检查。

---

# 第一部分：冷读测试（读者体验）

## 四条铁律（决定测试准不准）

**隔离。** 只给冷读者标题 + 正文。不给 brief、不给原始素材、不给写作意图、不告诉它你是谁想达到什么效果。它一旦知道你想让它得出什么结论，测试当场作废——它会脑补出本不存在的理解。

**单遍。** 明确要求读一遍、凭第一感觉、不许回头重读。现实里读者不会重读一篇文章。

**Q1 第一个问、第一个答。** 一旦它开始做后面那种「哪里没懂」的分析，就对文本过度加工了。可转述性这颗珠子，只能趁它读完第一遍、还热乎的时候摘。

**绝不暗示。** 四个问题本身不许带判断（不能问「开头是不是太慢」，只能问「第一次想划走是在哪」）。

## 执行：准备一个干净读者

**在 Cowork（推荐）：** fork 一个 subagent，跑在自己独立的、没有任何上下文串味的 context 里——这正是冷读需要的隔离，也正是它能代理真实读者的原因（真实读者从没看见你的写作过程，所以一个失忆的评估器才准）。给它的全部输入就是下面投喂模板，别的什么都不给。

**在 chat（临时单篇）：** 手动开一个全新会话贴模板。必须是新会话，当前会话已被写作上下文污染。

### 投喂模板（一字不改地给冷读者）

```
接下来给你一篇文章。请像刷手机第一次刷到它一样，从头读一遍，只读一遍，不要回头重读。

读完先回答第 1 题，凭第一印象，不要为了后面的题去补读。然后再依次回答 2、3、4。

【Q1】用一句话说，这篇到底在讲什么？——不要列它讲了哪些方面，就一句话，它最想让你记住的那个点。然后：如果要你把它转给一个同行，你会附一句什么话推荐？想不出该附什么，就直接说「想不出」。

【Q2】从头到尾，你第一次冒出「想跳过 / 想划走 / 走神了」的念头，是在哪一段？指出具体位置，再说一句为什么：无聊、没懂、信息太密喘不过气，还是不知道它讲这个干嘛（跟前面接不上）？

【Q3】这篇默认你已经知道、但它没解释的东西有哪些？把每一个让你需要猜、或者差点让你读不下去的术语、人名、概念、背景，全列出来。

【Q4】读完最后一段，你脑子里留下的是什么？这个结尾让你觉得「原来如此 / 有点东西」，还是「然后呢？」「就这？」，或者你根本没注意到它结束了？

———以下是文章———
标题：{标题}

{正文}
```

## 映射对照表（冷读信号 → 预测指标 → henry-writer 定位）

**Q1 那句话 ≠ 你想立的主线** → 分享率崩 → Layer 0.5 单一主线没立住/被淹没；扣主线句不够；可转述性检验没过。

**Q1 想不出转述附言** → 分享率崩 → 有知识没社交语境（社交语境 > 知识语境）；升华没给读者「值得转给别人」的理由。

**Q2 掉在前三分之一** → 完读率崩在开头 → 开头钩子结构（规则一·补丁）；第一帧没拉住；开头到第一部分衔接断了。

**Q2 掉在中间·无聊或太密** → 完读率崩在中段 → 节奏/气口（连续轰炸超过五段没喘息）；信息密度过载。

**Q2 掉在中间·接不上** → 完读率崩在中段 → 偏离主线没拉回；扣主线句缺失；倒金字塔乱了。

**Q3 列出一串未解释项** → 中段看不懂、评论「听不懂」 → 再封装/翻译没做；现象-数据-案例-对比缺背景；研究式扩展该补的前置没补。

**Q4「然后呢/就这/没注意到结束」** → 完读率崩在尾、读完无后劲 → 文化升维没起来；结构模板-升华太弱；收尾没用上。

**打开率不在冷读者射程内**——那是标题驱动的，归 qbitai-title-generator。冷读者只判断「点开之后」的一切。

---

# 第二部分：加权评分标尺（质量判别）

冷读测试测的是「读者会不会读完读懂」，这部分测的是「这稿够不够好」。两者互补。

## 核心：不对称加权

四个维度，但**绝不平均打分**。原理（详见 decisions 第 4 条）：模型在「工艺」和「功能」上默认就能拿高分，技术能力对它来说自然就有；但在「设计」和「原创」上，模型默认产出平庸甚至乏味的东西，会滑向那个流畅通用的均值（文字版「白底紫渐变」）。所以把判别力**重压在设计和原创上**，工艺和功能扫一眼过即可。

并且——评分标准的措辞本身就是方向盘。光是把「原创性 = 有没有横向映射」写进来这个动作，在任何反馈发生前就已经把写作端推离了通用默认。所以这套标尺同时塑造生成和验收两端。

## 四维标尺

### 工艺（轻判，default pass，检出即修）
技术执行：事实准确、数字/人名/时间/归属无误、句子通顺、逻辑接得上、结构不塌、违禁词（破折号、中式冒号乱用、metadiscourse、套话、空泛工具名）清干净。

这是能力检查不是创意检查，大多数合格实现默认就过。**fail = 基本功破了**。检出的机械问题直接标「就地修」，不占用判别力，不进重点报告。

### 功能（轻判，多与冷读测试 Q1-Q3 重叠）
可读性独立于美学：读者能不能理解这篇在讲什么、找到主线、不靠猜读完。冷读测试第一部分已覆盖大半，这里只补一句总判——**读者会不会在某处卡到读不下去**。fail 同样是基本功问题。

### 设计·整体感（重判，死磕）
这篇是不是一个有调性的整体，还是零件拼凑？开头、主体、升华、收尾是不是共同营造出一个连贯的气质，还是各写各的？强稿在这里的特征：你能说出这篇「是什么味道的」。

**fail 指纹**：段落各自为政、升华跟正文是两张皮、结尾的劲跟开头对不上、读完说不出这篇的整体气质。

### 原创（重判，死磕——这是 henry 的核心竞争力维度）
有没有刻意设计的痕迹，还是模板化的、谁都能写的通用产出？

四个具体检查：
1. **横向映射**：这篇有没有一个纯技术解读给不出的对照？（把新技术现象认成旧人性的新外衣——这是 henry 区别于纯技术解读者的差异点）
2. **人作主体**：叙事主体是具体的人，还是抽象的机构/技术？
3. **「咦」一下**：全文有没有至少一处让冷读者停一下、而不是顺滑划过去的地方？
4. **可转述性**：读者看完能不能用一句话跟朋友复述这篇在讲什么？

**fail 指纹（文字版紫渐变）**：「众所周知」式开头、PR 语言（颠覆性/全球领先/史无前例）、机构通稿腔、把人物故事写成机构动态、通篇是那种谁都能写的标准科技体、没有任何一个让人记住的对照或意象。命中任意一个，原创性判 fail，写进重点报告。

## 评分输出

```
【加权评分】
- 工艺：pass / fail（fail 项：___，已就地修 / 待修）
- 功能：pass / fail（fail 项：___）
- 设计·整体感：[评价 + 具体哪里塌了]   ← 重点
- 原创：[四项逐条 + fail 指纹命中情况]   ← 重点

【最伤的一条】（设计/原创里挑最伤的一条，对照 skill-editor 格式给定位/问题/建议/理由）
```

工艺和功能的 fail 直接就地修或一句话带过。**报告的篇幅和判别力都压在设计与原创上**——那才是决定这稿能不能破 10 万、转 3000 的地方，也是模型默认会写砸、需要 henry 盯的地方。

---

## 输出规则（合并两部分）

冷读测试四问 + 加权评分，合成一份报告。**一次只给最关键的一条改法**——通常落在设计或原创维度，因为工艺功能的问题就地修了。多个问题按优先级排，先解决最伤的。

诊断沿用 skill-editor 的固定格式，让三个工具说同一种话：

```
【定位】henry-writer 第X部分 / 某概念
【问题】冷读者/标尺暴露了什么（引原话或指 fail 指纹）
【建议】发表前可以怎么改
【理由】为什么这处会导致对应指标出问题
```

冷读抓到的问题大多是**这一篇就能改的执行问题**，不动 skill 文件——除非满足下面的升级条件。

---

## 什么时候升级到 skill-editor

**同一类问题被反复抓到**（多篇的冷读都掉在中段密度、或都在原创维度 fail 同一个指纹），说明这不是单篇执行问题，是 henry-writer 的系统性盲区。把这个反复出现的模式喂给 skill-editor 做 skill 级修改。

特别地：**加权标尺里设计/原创维度反复 fail 同一指纹，是最该升级的信号**——它指向 henry-writer 在无强约束时最容易滑向的那个平庸方向，值得把对应的「正向措辞」写进 henry-writer 的取材原则或 checklist，让方向盘在生成端就转过来。

---

## 与 henry-writer / skill-editor 的关系

cold-reader 卡在 henry-writer「第四步跑五层自检」之后、发表之前。五层自检是写稿的同一个实例在自检，带着全部上下文，模拟不了冷读者，也给不出独立的加权判别——cold-reader 来补这两个盲区。

三者分工：henry-writer 写，cold-reader 发表前预测 + 评分，skill-editor 发表后回溯。共用一套诊断语言、指向同样的位置。三个工具触发时机完全不同，不要混用。

