read-arxiv-paper · 论文深度阅读助手
输入 arxiv ID 或链接,获取论文全文,生成包含讲解内容的结构化中文阅读笔记,保存到 ~/papers/。
快速决策流程
- 解析输入 → 提取 clean arxiv ID(去掉版本号)
- 获取全文 → WebFetch 主路径,scrapling-official 备选
- 生成笔记 → 结构化中文笔记(含讲解内容)
- 保存文件 → 中文文件名保存到
~/papers/
第一步:解析 arxiv ID
接受以下格式,统一提取 clean ID(不含版本号):
| 输入示例 | 提取结果 |
|---|---|
2506.13832 |
2506.13832 |
2506.13832v2 |
2506.13832 |
https://arxiv.org/abs/2506.13832v1 |
2506.13832 |
https://arxiv.org/html/2506.13832 |
2506.13832 |
https://arxiv.org/pdf/2506.13832 |
2506.13832 |
如果用户没有提供 ID,询问:"请提供 arxiv 论文的 ID 或链接。"
第二步:获取论文全文
主路径:WebFetch HTML 版本
WebFetch: https://arxiv.org/html/{clean_id}
提示词: 提取论文的完整内容,包括标题、作者、摘要、正文各章节(引言、方法、实验、结论)、参考文献。保留章节结构。
判断是否成功:获取到的正文内容 > 2000 字,视为成功,直接进入第三步。
备选路径:scrapling-official 获取
如果 HTML 版本返回 404、内容过短(< 2000 字)或明显不完整,改用 scrapling-official 技能抓取:
scrapling-official: 抓取 https://arxiv.org/html/{clean_id}
如果仍然失败,尝试抓取 https://arxiv.org/abs/{clean_id} 获取详细摘要页面
降级策略
如果两种方式都无法获取完整正文(通常是老论文或特殊格式):
- 用 WebFetch 获取
https://arxiv.org/abs/{clean_id}的摘要页面 - 提取:标题、作者、分类、摘要
- 在笔记中注明:"本论文暂无 HTML 全文版本,以下分析基于摘要"
- 仍然生成完整结构的笔记,讲解内容部分根据摘要尽力展开
第三步:生成结构化中文笔记
用获取到的全文内容,生成以下结构的详细中文笔记。这是技能的核心,要求准确、深入、有助于读者真正理解论文。
笔记模板
# {中文标题}
> **原标题:** {英文标题}
> **作者:** {作者列表}
> **发布时间:** {日期} · **分类:** {arxiv 分类}
> **ArXiv:** [{clean_id}](https://arxiv.org/abs/{clean_id})
> **阅读笔记生成时间:** {生成日期}
---
## 一句话概括
{用一句话清晰说明:这篇论文做了什么、解决了什么问题、核心贡献是什么。要具体,避免空泛。}
---
## 问题与动机
{
说明这篇论文要解决的具体问题,以及为什么这个问题重要:
- 现有方法或技术存在什么缺陷/局限?
- 这个问题在实际应用中有什么影响?
- 为什么现在是解决这个问题的好时机?
}
---
## 核心方法
{
描述论文提出的方法、模型或算法:
- 整体框架/架构是什么?
- 关键的创新设计是什么?
- 与已有方法的本质区别是什么?
如有图表或公式,用文字解释其含义。
}
---
## 实验与结果
{
- 在哪些数据集/任务上做了实验?
- 与哪些基线方法对比?
- 核心结论是什么(数字要具体)?
- 消融实验说明了什么?
}
---
## 贡献与局限
{
**贡献:**
- 列出 2-3 个核心贡献(学术价值 + 实用价值)
**局限性:**
- 作者承认的局限,或你认为存在的局限
- 未来可以改进的方向
}
---
## 讲解内容
{
这是最重要的部分:用通俗语言深度解释论文的核心思想,目标是让读者真正"懂"而不只是"知道"。
**核心思路讲解:**
解释论文背后的直觉和洞察——为什么这个方法能奏效?作者是怎么想到这个方案的?用类比或例子来解释抽象的技术概念。
**关键技术细节:**
挑选 2-3 个最重要的技术点,逐一讲清楚:这个机制是干什么的,怎么实现的,为什么这样设计比其他方式好。
**与已有工作的联系:**
这篇论文和哪些相关工作有承接关系?它在整个领域的研究脉络中处于什么位置?
**读后思考:**
读完这篇论文,你觉得最有价值的点是什么?有什么启发?有什么值得质疑或进一步探索的地方?
}
---
## 关键词
`{关键词1}` `{关键词2}` `{关键词3}` ...
第四步:保存文件
文件命名规则
文件名使用中文标题,格式:{中文标题}.md
- 将英文标题翻译为简洁的中文(5-15 字为宜)
- 去掉标点符号,空格替换为空格(保留)
- 例:
Nested Gaussian Splatting→嵌套高斯泼溅.md
保存位置
所有文件保存到 ~/papers/:
~/papers/
{中文标题}.md # 中文阅读笔记(主文件)
{中文标题}_原文.md # 原始论文正文(如果成功获取了全文)
中文笔记(主文件):包含完整的结构化笔记(见上方模板)。
原文存档(可选):如果获取到了完整正文(> 2000 字),同时保存一份原始内容到 {中文标题}_原文.md,格式:
# {英文标题} - 原文存档
> 来源:https://arxiv.org/abs/{clean_id}
> 抓取时间:{日期}
---
{原始正文内容}
保存后反馈
保存完成后,告知用户:
✅ 论文阅读笔记已保存:
📝 笔记:~/papers/{中文标题}.md
📄 原文:~/papers/{中文标题}_原文.md(如果获取到全文)
然后在对话中展示笔记的完整内容,方便用户直接阅读。
注意事项
- arxiv HTML 版本(
/html/{id})是最好的全文来源,约 70-80% 的论文有此版本;老论文(2020 年以前)通常没有 - 公式用文字描述其含义,不要原样照抄 LaTeX 符号
- 讲解内容部分要有深度,不是摘要的复述,而是帮助读者建立理解
- 如果论文较长,聚焦在摘要、引言、方法、实验、结论等核心章节
- 中文翻译要自然流畅,技术术语保留括号内的英文原文,例如:注意力机制(Attention)