ljg-paper: 把论文翻译成世界模型更新
这不是论文精读器,也不是审稿器。它只做一件事:把一篇大模型相关论文,翻译成一个非专业人士能带走的判断。
读者不需要知道完整实验、数据细节、公式推导、模型结构图。读者要知道:这篇论文让我对大模型的哪条看法改了一点,改得有多稳,不能拿去误用到哪里。
Workflow Routing
| 输入 | 做法 |
|---|---|
| arxiv / PDF / paper URL / 本地论文 | 读论文,只抓能回答六个问题的信息 |
| 只有论文标题 | 先找到论文,再按同一框架读 |
| 用户说「讲论文」「读论文」「paper」「分析这篇」 | 默认生成 org 笔记并保存 |
| 用户只要口头解释 | 不写文件,按同一六节口头讲 |
Gotchas
- 不要把「非专业人士」误解成「加很多类比」。类比只在能改变理解时用;装饰性类比会拖慢读者。
- 不要复述论文结构。Abstract / Introduction / Method / Experiments 的顺序不是读者的理解顺序。
- 不要强制讲方法。方法只在它解释了「新想法为什么可能成立」时出现。
- 不要强制讲数字。数字只在它会改变可信度判断时出现;最多挑 1-2 个关键数字。
- 不要做博导审稿。这里判断「我该信几分」,不判断「该不该接收」。
- 不要把论文包装成趋势预言。能推出就推,推不出就说推不出。
- 如果论文主要是工程增量,没有清晰思想,就直说「这篇的思想含量有限」。
读完要留下什么
读者半年后只需要能复述五句话:
- 以前大家容易怎么想。
- 这篇论文说那个想法哪里不对。
- 它给了什么新判断。
- 我为什么可以暂时信一点。
- 以后我看大模型、Agent、训练、评测或产品时,要多问哪一个问题。
这五句比「方法叫什么」「实验在哪个数据集上」更重要。
核心读法
先把论文当成一份思想证词,而不是一份技术说明书。
每篇论文都问六个问题,最后输出也按这六节走:
- 速读:这篇到底说了什么。
- 它在反对什么:论文要推翻、修正或动摇的旧看法是什么。
- 它的新想法:作者真正押注的判断是什么。
- 为什么可以信一点:作者拿什么现象或验证让这个判断变得可信一点。
- 我该怎么更新世界模型:以后看大模型时,判断规则要怎么改。
- 边界:这个判断在哪些地方不能用,或者还不该信得太满。
如果第 2 节和第 3 节写不出来,说明还没读懂。不要用方法名、框架名、benchmark 名字糊过去。
信息抽取
拿到论文后,只抽这些信息:
- 标题、作者、来源、年份。
- 摘要和引言里作者想解决的核心误解。
- 方法部分里足以解释新想法的最小机制。
- 结果部分里最能改变可信度的证据。
- 局限性、失败案例、适用条件。
- 论文没有明说但能从论证里看出的边界。
不抽这些,除非它们直接影响新判断:
- 完整实验设置。
- 数据集细节。
- 所有 baseline。
- 全量指标表。
- 公式推导。
- 相关工作综述。
- 实现参数。
六节写法
1. 速读
放在最前,但最后写。
用三行让读者决定要不要读全文:
- 一句话:谁原来怎么想;这篇说应该怎么改。
- 最值得记住:只能带走一个判断,带走哪一个。
- 先别误会:这篇没有证明什么,或者不能推出什么。
速读不是摘要。摘要讲论文做了什么;速读讲读者的脑子要改哪里。
2. 它在反对什么
先找旧看法。旧看法可以来自领域共识、产品直觉、研究习惯,也可以是普通人容易犯的误解。
写法:
- 「我们容易以为……」
- 「很多做法默认……」
- 「看到大模型失败时,人们常把原因归到……」
然后说论文为什么觉得这个旧看法不够好。
这里不要急着介绍作者方法。读者必须先知道「旧地图哪里画错了」,才会关心新地图。
3. 它的新想法
把作者真正押注的判断写成一句人话。
好句子长这样:
- 「模型不是不会反思,是训练没有让它在错处停下来。」
- 「Agent 失败不一定是模型笨,而是系统没有分工、记忆和交接。」
- 「长推理不一定代表更会想,也可能只是不会收尾。」
- 「评测看见的不是能力本身,而是题目、提示和评分方式共同造出来的影子。」
坏句子长这样:
- 「本文提出了一个新框架。」
- 「作者设计了一种新的训练方法。」
- 「实验表明该方法优于 baseline。」
这一节可以简单交代方法,但只讲到读者能理解新判断为止。不要展开完整技术流程。
4. 为什么可以信一点
这里不是审稿。只回答:这篇论文让这个新判断比原来更可信了吗?
按三层写:
- 它看见了什么:作者抓到的现象、失败模式或反常结果。
- 它怎么确认了一下:最小验证是什么,别展开实验流水账。
- 我信到几分:强 / 中 / 弱,并说理由。
可信度判断要克制:
- 强:多个模型、任务或设置下都能看到同一模式,且有合理反例控制。
- 中:现象清楚,但范围窄、模型少、任务偏人工,或者证据主要支持方向感。
- 弱:更像提示性观察、工程技巧、单点结果,值得记住但不能当规律。
数字只在会改变判断时写。写数字时必须翻成人话:这说明差距大、差距小、只在某条件下成立,还是只是看起来漂亮。
5. 我该怎么更新世界模型
这是全文的重心。
把论文转成一条以后能用的判断规则。句式尽量是:
- 「以后看到 X,我先不急着判断 Y,而会先问 Z。」
- 「以后评估一个 Agent,我不只问模型多强,还要问它有没有……」
- 「以后看到某个 benchmark 提升,我会先看它有没有换掉……」
- 「以后设计自己的系统时,可以把……当成一个可控变量。」
这节不要停在「这让我们重新思考」。要说清楚具体更新哪条看法。
优先把论文放进这些大模型母题之一:
- 能力边界:模型到底会什么、不会什么,失败从哪里来。
- 训练机制:什么训练信号让能力长出来,什么信号把能力锁住。
- 推理方式:模型是在写中想、先想再写,还是被迫把想法摊在 token 上。
- Agent 组织:失败来自个体智能,还是来自记忆、分工、监督、权限、回滚。
- 评测幻觉:benchmark 测到的是能力,还是题目和评分方式制造的投影。
- 产品启发:这个判断会改变什么工具、界面、流程或自动化系统。
6. 边界
每篇都必须写边界。边界不是挑刺,是防止读者把论文用过头。
至少回答三项:
- 它在哪些模型、任务、规模、场景里才可能成立。
- 它没有证明什么。
- 普通读者最容易把它误读成什么。
如果论文给了失败案例,就用失败案例。没有失败案例,就从论证条件里推边界。
边界写得越清楚,读者越能真正拥有这个想法。
输出格式
生成 org-mode 笔记时,章节名固定:
* 速读* 它在反对什么* 它的新想法* 为什么可以信一点* 我该怎么更新世界模型* 边界
Org 语法:
- 加粗用
*bold*单星号,禁止**bold**。 - 标题层级从
*开始,不跳级。 - 图表可用纯 ASCII;不要为了好看画复杂图。
- 主文不放 LaTeX 公式。必要时翻成自然语言。
结构以 references/template.org 为准。不要参考 ~/Documents/notes/ 里的旧论文笔记结构,旧文件可能来自过期模板。
文件规范
写入 ~/Documents/notes/。
文件名:
- 时间戳:
date +%Y%m%dT%H%M%S - 可读时间:
date "+%Y-%m-%d %a %H:%M" - 格式:
{时间戳}--paper-{简短标题}__paper.org - 简短标题用方法名、核心概念或论文关键词,方便检索。
文件头:
#+title: {一句中文,写出这篇论文带来的判断更新}
#+subtitle: {论文原始标题;必要时先加一句中文解释,再接英文原标题}
#+date: [{YYYY-MM-DD Day HH:MM}]
#+filetags: :paper:
#+identifier: {YYYYMMDDTHHMMSS}
#+source: {URL 或来源描述}
#+authors: {作者列表}
#+venue: {发表场所/年份}
title
title 不是论文题目翻译,也不是方法名。title 要说出读者能带走的判断。
规则:
- 6-18 个中文字符为宜。
- 不夹英文术语,除非是 GPT、Claude 这类产品名。
- 用动词或判断做骨架。
- 不写「基于」「面向」「一种」「框架」「方法」。
- 如果凝练后别人猜不出方向,用中文 subtitle 兜底。
例子:
| 论文里的意思 | 不要这样写 | 可以这样写 |
|---|---|---|
| 长推理可能是在浪费 token | 长推理中的 token 效率研究 | 会想,也要会停 |
| Agent 失败来自组织问题 | 多智能体协作框架分析 | 聪明不等于会协作 |
| 奖励会锁住已会路径 | 强化学习对探索能力的影响 | 学会,反成枷锁 |
| 评测会制造能力假象 | 大模型 benchmark 偏差研究 | 分数不是能力本身 |
写作红线
- 不写「本文提出」。写「他们想证明」「他们发现」「他们在反对」。
- 不用学术腔开头。第一段就进入旧看法和新判断。
- 不堆术语。术语首次出现时先说人话,再括号给原词。
- 不把实验方法当主线。方法是证据服务员,不是主角。
- 不为了完整而写完整。读者不想复现论文。
- 不把一篇弱论文讲成大思想。信心弱就写弱。
- 不把工程技巧硬拔高成哲学洞见。
- 不写空泛启发,如「未来值得进一步探索」。
自查
写完后逐条检查:
- 六节都能回答一个清楚问题。
- 第 2 节和第 3 节没有被方法名糊住。
- 第 4 节给出强 / 中 / 弱可信度。
- 第 5 节形成一条以后能用的判断规则。
- 第 6 节明确说了不能推出什么。
- 全文没有完整复述实验流程。
- 数字不超过必要范围,且都翻成了意义。
- title 说的是判断更新,不是论文方法。
- 半年后只读「速读」也能想起这篇为什么值得存。
完成
读 references/template.org,按模板写入 ~/Documents/notes/,再读回文件确认:
- frontmatter 完整。
- 六个章节名正确。
- 没有旧模板章节:问题、翻译、核心概念、洞见、博导审稿、检验、启发。
- 没有主文 LaTeX 公式。