雙欄論文閱讀器(Bilingual Paper Reader)
這個 skill 實際上是什麼(先講清楚,避免誤解)
- 閱讀器是一支、論文是資料檔。
reader.html可重複使用,任何論文轉成 JSON 都用它開。 - 翻譯與預先標記需要你(Claude)在場。 閱讀器本身是靜態 HTML,沒有 LLM, 無法自己翻譯。每篇論文要開一次 session 讓你翻。
- 標記存在瀏覽器 localStorage,清除瀏覽器資料會一併清掉—— 重要筆記務必用「匯出筆記」存成 Markdown 備份。這點要主動告訴使用者。
- 掃描版 PDF(無文字層)抽不到文字,需先 OCR。工具會明確報錯,不會產出空檔。
與同族 skill 分工
| 需求 | 該用 |
|---|---|
| 一批文獻的橫向比較(建庫、矩陣、APA7、DOI) | literature-matrix-builder |
| 規模化文字量化(財報語調、主題模型、LLM 標註) | text-analytics-architect |
| 單篇方法論逆向、找研究缺口、系統性回顧 | phd-researcher |
| 單篇論文的雙語精讀與重點標記 | 本 skill |
精讀完的判斷(核心主張/創新點/弱點)可回填進 literature-matrix-builder
的綜整欄——兩支是天然接力。Claude Code 環境呼叫同族技能須加 anthropic-skills: 前綴。
工作流程
Step 1|PDF → 論文資料檔
python scripts/pdf_to_paper.py paper.pdf -o paper.json --title "論文標題"
會切段、濾掉頁首頁尾雜訊、標出疑似表格的段落(skip: likely_table)。
若報錯說抽不到文字,代表是掃描版 PDF,請使用者先 OCR。
Step 2|先建術語對照表
翻譯前先掃一遍全文,把反覆出現的關鍵術語列進 JSON 的 glossary。
這一步不能跳過——術語不一致是學術翻譯最常見也最傷的錯誤。
規範見 references/translation-discipline.md。
Step 3|逐段翻譯
填每段的 trans。紀律見 references/translation-discipline.md,重點:
- 一段對一段,不合併不拆分
- 人名/期刊名/統計符號/變數名不翻
- 數字、係數、p 值原樣照抄(數字零容忍)
- 因果強度用詞不可弱化或加強(
suggests≠ 證明) - 看不懂就標「原文語意不明確,暫譯為…」,不要硬翻出通順的錯譯
翻譯量要先講:全文常有 50–120 段。先問使用者要全翻還是先翻 摘要/引言貢獻段/方法/結論這四塊,不要默默決定。
Step 4|五色預先標記
填每段的 marks。分類判準與位移算法見 references/highlight-taxonomy.md。
寧少勿濫——每段都標等於沒標。
Step 5|交付與判斷
告訴使用者怎麼開,並附上你的判斷(比標記更有價值):
## 這篇的關鍵判斷
- 核心主張:〔一句話〕
- 最創新之處:〔一句話;貢獻宣稱不明確就直說〕
- 最大弱點:〔區分作者自承 vs 你讀出來的〕
- 與你研究的關聯:〔一句話〕
輸出格式
# 精讀:〔論文標題〕
## 處理狀態
- 段落 N 段(其中 M 段為表格已略過)
- 已翻譯:〔全文/指定章節〕
- 預先標記:核心 a、創新 b、方法 c、限制 d、金句 e
## 這篇的關鍵判斷
〔如上四點〕
## 怎麼開
1. 用瀏覽器開啟 scripts/reader.html
2. 把 〔paper.json 路徑〕 拖進去
3. 選取文字可自己畫螢光筆;按「匯出筆記」存成 Markdown
## 提醒
- 標記存在瀏覽器 localStorage,清除瀏覽器資料會消失,重要筆記請匯出備份
- 〔翻譯中標為語意不明確的段落,請對照原文第 N 頁確認〕
Constraints(誠實防線)
- 不生通順的錯譯。看不懂就標示不確定並指出該查原文哪裡。
- 不改數字。係數、樣本數、p 值、年份一律原樣。
- 不誇大貢獻。論文的貢獻宣稱不明確時直說,不要替作者補一個漂亮的創新點。
- 不假裝閱讀器能自己翻譯。使用者若期待「裝一次以後都不用你」, 明確說明翻譯需要你在場,並建議若要全自動可改用現成的沉浸式翻譯軟體。
- 標記位移算錯會標到錯的字——填 marks 前先核對字串位置。
風格
繁體中文、台灣學術慣例。回報精簡,重點放在「這篇的關鍵判斷」四點。