科学论文叙事解读
把论文写成一条可追踪的推理链:领域为什么卡住,作者改变了什么,证据是否撑得住,真正的新意在哪里,结论的边界又在哪里。保持科学精度,不复刻任何具体作者的个人措辞。
工作流
获取材料。
- 优先读取论文全文、图注、方法、讨论和补充材料。
- 用户给出参考文章时,同时提取其结构、节奏和读者假设;只抽象可迁移技法,不照抄句式。
- 网页受限时,使用用户提供的 PDF 或导出文件;无法取得全文时,明确说明覆盖范围。
- 用户提供视觉参考时,先做一次“编辑取样”:记录标题层级、正文宽度、段落长度、重点色、图片密度、单图宽度、图注方式和裁切习惯。不要只模仿语气而忽略版式。
建立证据台账。
- 记录研究问题、数据规模、比较基线、训练与测试边界、主要指标、独立验证、局限和开放资源。
- 将每条信息标记为“论文直接报告”“作者解释”或“解读者推断”。
- 对所有数字回到原表、图注或正文复核;区分绝对提升与相对提升。
找出唯一叙事主轴。
- 用一句问题定义文章:
旧方法为什么不能 X,作者怎样让 Y 成为可能? - 选择一项最能体现独特价值的实验作为高潮,而不是平均分配篇幅。
- 把常规分类任务当作表征验证,把真正改变研究或临床工作流的结果放到后半程重点展开。
- 用一句问题定义文章:
按因果顺序组织。
- 开篇对比熟悉范式与新范式,快速给出“多学了什么”。
- 解释数据为何让旧方法失效,再提出论文的核心问题。
- 将每个方法设计写成“障碍 -> 设计 -> 为什么有效 -> 带来什么能力”。
- 结果按“基础能力 -> 跨队列泛化 -> 工作流价值 -> 关键发现”逐级推进。
- 结尾先给出判断,再写限制、适用边界、开放性和下一步。
写作并做反夸大检查。
- 使用短段落、自然设问和明确转折;首次出现术语时立即用普通语言解释。
- 为公众号长文先列“蓝色阅读锚点”:中心判断、关键证据、方法/对象、限制边界四类都要出现,并分布在概览、方法、结果高潮和讨论中。锚点应是脱离上下文仍自然完整的意义单元,不是孤立模型名、裸数字或整段加粗。
- 数字只在回答具体问题时出现,并说明样本、指标和比较对象。
- 不把相关性写成因果,不把回顾性结果写成临床可用,不把跨任务骨干写成无需下游模型的端到端系统。
- 独立队列若缺少原任务标签,明确它验证的是迁移相关性或预后价值,而非原任务的独立复现。
设计并校验图文节奏。
- 先列“图版台账”:精确到原 PDF 页码、Figure/panel、裁切重点、出现位置和该图能证明什么。
- 复杂多面板图优先拆成手机端可读的单元。裁掉页眉、页码、正文和论文长图注,但必须保留 panel 字母、坐标轴、图例、统计标记、比例尺及理解结论所需的对照组。
- 默认每 2-4 个短段落安排一个视觉节点;先提出图要回答的问题,图后分别写“看到了什么”和“不能说明什么”。不连续堆放两张未经解释的复杂图。
- 交付前渲染最终 PDF,逐页检查裁切、字号、留白、断页和图片清晰度。
图文交付硬门槛
用户要求公众号稿、图文稿、截图、Figure 排版或提供论文 PDF 时,执行以下规则:
- 把“配图建议”和图版台账只当作内部计划;最终正文不得保留
【配图建议】、待补图、TODO 图等占位文本。 - 在完成写作前,从原论文 PDF 或期刊官方原图实际生成图片资产。每个计划使用的 Figure 必须同时具备:存在的图片文件、正文中的 Markdown 图片引用、紧随其后的中文图注,以及可追溯的 Figure/panel 来源。
- 不得把只有图版台账、但没有
引用的 Markdown 称为“图文稿”。除非用户明确要求纯文字,零图片稿一律视为未完成。 - 图片引用路径必须能从 Markdown 文件位置解析;交付前运行
scripts/validate_article_assets.py --require-images --require-captions <article.md>。校验失败时继续修复,不得交付。 - 每个裁图资产必须有机器可读的 crop manifest,至少记录源渲染页、输出图片、裁框坐标和人工确认的
required_bounds(理解该 panel 所需内容的最外层边界)。运行scripts/validate_figure_crops.py <manifest> --review-dir <dir>,要求裁框包住required_bounds、输出尺寸匹配裁框且像素与源页一致。该校验不替代人工判断。 - 对每张 review sheet 做源图—裁图对照:红框是实际裁框,绿框是必须保留的内容边界。逐项确认 panel 字母、标题、所有底部/侧边标签、坐标轴、单位、图例、统计符号、比例尺和关键对照都在框内;四边至少留少量安全余量。不能只看主图中央,也不能用“图片存在”或“PDF 中已出现”代替完整性审阅。
- 若还需 PDF,先通过资产与裁图校验,再构建并渲染 PDF;逐页确认正文中的每张图都实际出现、内容完整且可读。仅有 Markdown 路径存在不足以代替视觉检查。
输出结构
默认使用以下结构;短答可压缩,但保留同一逻辑:
- 标题:对象 + 核心变化 + 一个读者问题。
- 推文概览:4-7 段,给出背景对照、模型能力和一句中心判断。
- 最值得关注的地方:把论文价值凝结为一个领域级问题。
- 背景与问题定义:说明数据异质性和旧流程代价。
- 方法拆解:每一节只解释一个设计决策。
- 结果与验证:先证能力,再证泛化,最后写最有区分度的发现。
- 讨论与总结:判断是否名副其实,列出证据、边界与未来方向。
需要更细的段落模板、节奏规则和质量检查时,读取 references/narrative-blueprint.md。
用户要求匹配公众号文章、技术媒体或给出视觉参考 PDF 时,还必须读取 references/wechat-editorial-design.md。
交付标准
- 让非本方向科研读者能复述“问题、三项关键设计、最强证据、两项限制”。
- 保留研究设计中会改变结论的限定词、样本量和验证边界。
- 把“作者做了什么”和“这意味着什么”分开表达。
- 使用原始论文和官方代码/数据页面作为事实来源;参考解读文章只用于叙事分析。
- 文末给出可点击的一手来源,不使用无法追溯的二手数字。
- 同时交付可编辑正文与可审阅版 PDF 时,两者的标题、数字、限定词和图序必须一致。
- 图文交付中不存在配图占位符;图版台账、正文图片引用、磁盘资产和最终 PDF 四者一致。
- 公众号稿的蓝色粗体不是收尾装饰:构建前运行
scripts/validate_emphasis_style.py <article.md>;再由未参与写作的审阅轮次判断,扫读全部蓝字能否复述全文推理链,且没有丢掉否定、比较对象或验证边界。 - 参考风格复测六项均应达到 4/5:语言精炼、句式、段落节奏、标题层级、配图布局与裁切、科学谨慎性;低于 4/5 的维度须在交付前修订。