何时使用
当用户给出一位教授的姓名 + 至少一个公开来源(Google Scholar / 个人主页 / 实验室主页),并希望:判断是否值得申请、对比多位导师、推断未来招生方向、撰写套磁邮件、找毕设/硕论/读博导师、或基于公开证据建立结构化档案时使用。本技能跨学科、跨平台、跨申请层级(博士/硕士/本科/RA/博后/访学/合作者),优先使用公开学术来源。
不该用的边界:
- 仅有教授姓名、无任何 URL 或文献来源时——先索要至少一个链接或论文列表,不要凭名字臆测。
- 不替代与在读学生/校友的实际打听;证据模糊时本技能给出"需进一步核实",而非定论。
- 不把引用数 / h-index / 论文数量等同于质量,不把高产等同于好导师或过劳。
- 不用 CS/ML 范式硬套人文、社科、临床、纯数学等领域(单作者、低产、专著、理论贡献在其领域内均属正常且高声望)。
步骤
- 判定领域、建立领域画像(Field Profile):从院系、发表场所、关键词确定主领域,并明确六个维度——发表文化(会议驱动/期刊驱动/专著驱动/混合)、署名规范(一作+末位通讯/字母序/单作者常见/大团队)、典型课题组结构、产量基准、资源类型、指导文化。后续每一步都按此画像解读。
- 教授快照:机构、院系、实验室、研究方向、公开学生/校友名单、近期职衔、逐年发文量、高频场所、高频合作者、可见的经费/数据集/系统线索;末尾写一段"学术身份"概括。
- 研究时间线:按年组织,标注产量(对照领域基准)、场所组合、署名模式、复现的学生与合作者、主题兴衰、投稿周期附近的爆发;识别早期/巩固/扩张/近期转向四阶段。
- 研究谱系:聚类成体系而非平铺,必含六桶——核心研究线、次要线、应用分支、共享方法论主干、近期转向、可能扩张方向;每桶标出奠基/延续/转折/旁支/可能跟风之作。
- 逐篇读取并抽取结构化证据:每篇给出元数据(按领域署名规范解读一作/通讯、判定 student-led/professor-led/unclear)、问题、方法/论证、新颖性(用通用类目:问题重构/概念洞见/方法创新/数据资源/系统基建/理论分析/经验发现/诠释批判/临床转化/综述)、资源(标注"直接陈述"或"推断")、署名分析、影响信号、写作质量、置信度(高/中/低)。
- 教授层面综合判断:沿六维评估——研究强度、指导强度、合作网络、资源画像(按领域)、工作量与文化风险(对照领域基准)、教学与沟通信号;每维给出判断 + 支撑证据 + 至少 2 个备选解释 + 置信度。
- 未来方向与招生空缺推断:综合 future-work 陈述、近 2-3 年转向、新合作者、新数据集/方法/系统、反复出现的瓶颈、新经费,回答最可能扩张处、最缺人处、哪些方向持久、哪些可能是跟风。
- 申请人适配分析:先按层级+领域校准,再把申请人映射到通用研究角色(经验研究者/理论构建者/诠释学者/临床转化研究者/质性研究者/方法论者/资源创造者/跨域桥梁/应用专才/学徒型);判断为何契合、为何有风险、加入难度、应突出什么、需补什么;并做"导师-学生类型匹配"(自由探索 vs 需明确方向、快产出 vs 深耕等)。 7B. 预警信号(始终出现,即使为空也要明确写"未发现"):研究方向漂移、学生发展隐忧、层级专属风险、领域专属风险、合作依赖、课题组动态;每条标证据等级(A/B/C/D)与严重度(blocking / serious / minor)及是否有良性解释。
- 套磁邮件:围绕 1-2 条具体研究线 + 1 个可贡献点 + 1 个用功证据 + 1 个互惠理由;按层级出版本(博士/硕论/本科/合作/破冰)。
- 对话与面谈剧本:按层级给出教授可能提问、各题考察点、强答结构、失败模式、反问清单、如何抛小想法。
- 以可执行的后续动作收尾。
指令
证据阶梯(每个非平凡判断都套用):
- A 直接证据:来源直接陈述(论文写明数据规模、实验室页面列明学生身份、经费库显示金额)。
- B 强间接证据:重复信号强支撑(同一人多年挂一作且列于实验室页、同一外部合作者贯穿一条研究线、多篇致谢同一经费)。
- C 合理推断:可信但未确证(从项目规模推资源强度、从学生署名成长推指导模式)。
- D 推测:弱支撑,须显式标注(从单次爆发推文化、仅凭文风推性格)。
强制语言提示词:"directly supported by" / "suggested by repeated evidence" / "reasonable inference" / "cannot be concluded from public evidence alone"。
反证协议(每个重大判断给五项):claim、supporting evidence、alternative explanations(≥2-3 个)、weighted judgment(最可能解释 + 粗略置信权重)、what would reduce uncertainty。模糊阈值规则:当支撑与反证势均力敌时,不得默认正面解读,须显式声明模糊并建议进一步打听(找在读学生、读实验室新闻、查领域社区)。
来源采集优先序:Scholar → 个人/实验室主页 → 领域文献库(CS/ML: DBLP、ACL Anthology;生医: PubMed、Europe PMC、ClinicalTrials.gov;社科经济: SSRN、RePEc、EconLit;人文哲学: PhilPapers、JSTOR;数学: MathSciNet、zbMATH;物理: INSPIRE-HEP、ADS;通用: Scopus、Web of Science)→ 预印本(arXiv/bioRxiv/medRxiv/SSRN)→ Semantic Scholar → 学生/校友页与 CV → 经费库(NSF、NIH Reporter、MOST、ERC)→ 学位论文库。来源冲突时取最权威者并标明冲突。
覆盖率政策:默认覆盖现实可及的全部论文;语料过大时用透明三层(Tier1 核心 / Tier2 支撑 / Tier3 边缘),并始终报告:识别总数、深读数、略读/元数据推断数、哪些结论依赖部分覆盖。绝不静默抽样。
语言策略:默认输出中文,但论文标题、场所名(NeurIPS、ACL、Nature)、方法/模型名(Transformer、CRISPR、difference-in-differences)、无通用译名的术语、专有名词保持英文;用户用英文则全切英文。
示例
输入:「帮我分析一下 Stanford 的 X 教授(这是他的 Google Scholar 链接),我是想申请 2027 Fall 的博士,背景是 NLP 方向有一篇 workshop 一作。」
处理:
- 先确认层级=博士申请、领域=NLP(会议驱动、一作+末位通讯、高产、compute-heavy)。
- 抓取 Scholar + 主页 + DBLP/ACL Anthology,建快照与时间线,标注近 2-3 年是否从 X 方向转向 Y。
- 谱系聚类,逐篇标注哪些是 student-led(学生一作连续成长=指导信号,B 级证据)。
- 六维评估,对"近一年 30 篇"给出至少两解(大组多人独立产出 vs 切片式碎片化),权衡后给置信度。
- 适配:把申请人映射为"经验研究者(学徒过渡)",指出 workshop 一作是加分但需展示研究成熟度;预警若该教授近年无学生一作则标 serious。
- 产出博士版套磁(围绕 1-2 条研究线 + 可贡献的工程/数据点)+ 20 分钟面谈结构 + 三个后续动作(如"读 Z 论文""准备 X 方向小提案""联系在读学生 Y")。
注意事项
- 不把推测当事实;不从单篇论文推断工作量、性格或伦理。
- 不假设所有高频合作者都是学生;不假设所有末位作者论文都由教授主导。
- 不用 STEM 范式套人文/社科;不用台架科学范式套临床/公卫/人群研究——不同研究设计有不同时间线、署名与资源要求。
- 不因领域常态的低产量、单作者、无大实验室、无计算/实验技能而扣分。
- 绝不声称读过你无法访问的论文;不隐藏访问限制或覆盖不全;不编造校友去向。
- 不为博取好感而优化,为决策有用性而优化。
- 高风险推断(指导质量、过劳、学生贡献份额、经费水平、伦理、人际风格、临床时间占用、理论开放度、毕业生就业前景)须格外谨慎、显式标注不确定性。
互见
- fact-checking:核验从公开来源提取的事实性断言与潜在冲突。
- first-principles-thinking:在证据模糊、需拆解"高产到底意味着什么"等多解问题时辅助推理。
本条采编自 voidful/academic-skills(professor-fit-analyzer,MIT 许可)。