Scholar Lab —— 文献检索与整理流水线
从研究问题到整理好的 xlsx,全程一条龙。三个子技能按顺序调用:
- keywords —— 从问题描述提炼检索关键词(LLM 驱动,含近义词扩展与歧义消解),必须停下来让用户确认/筛选。
- search —— 用确认后的关键词,经 CDP 驱动真实 Chrome 检索 Google Scholar。
- manage —— LLM 自动标注每条结果(中文标题/问题/方法/相关性),导出 xlsx。
使用流程
把 $ARGUMENTS(或用户最新一条消息里的研究问题描述)当作问题输入,然后:
- 调用
keywords子技能提炼关键词 → 停下,等用户确认。 - 用户确认后,调用
search子技能检索。 - 调用
manage子技能标注并导出 xlsx。 - (可选)若用户要导入 Zotero,用
scripts/push_to_zotero.py。
期刊目录
- 若用户给定了期刊目录(例如"只检索 TR-B / TS / EJOR"或给出一个期刊清单),把期刊名写入
journals.txt传给cdp_search.py --journals,只检索目录内期刊。 - 若用户没给目录,默认检索全部期刊。
- 目录可在用户的问题描述里出现,也可单独给一份文件;keywords 步要把它识别出来并纳入确认。
时间范围
- 若用户给定了时间范围(如"近三年"),加
--from-year YYYY --to-year YYYY;可只给一端(如--from-year 2023)。 - 若没给,默认检索全部文献。
- 时间范围同样在 keywords 步识别并纳入确认。
首次使用(一次性)
必须先完成 docs/SETUP.md 里的配置:启动持久 profile 的 Chrome、手动过一次验证码、登录 Google。之后 cookie 会保留,无需重复。
注意
- 检索走 CDP 脚本,不依赖 chrome-devtools MCP。
- 关键词确认是硬闸门:用户没点头,不许进检索。
- 导出只有 xlsx(字段固定 9 列),不生成 docx/csv。