流行病学研究设计
在查看结果或编写主要分析代码前,确认研究问题、设计选择和统计分析计划。围绕已有资料、需要决定的事项、目标文件和完成标准推进,只追问会改变研究答案的缺失信息。
1. 界定任务
- 先对齐
biostat-principles,判定轻量设计咨询或正式项目。 - 读取用户材料;正式项目同时读取项目
CLAUDE.md、BACKLOG.md、已有PROTOCOL.md、SAP.md和DECISIONS.md。 - 判断本次是新设计、方案补全、SAP 细化或设计审查,不自动扩展到项目初始化、分析或写作。
- 涉及结局定义、量表、方法依据、报告规范或最新指南时,先用
evidence-research核验来源身份和适用性。
2. 建立研究设计要点
按以下顺序形成可审查的研究设计:
- 研究问题:明确目标人群、暴露或干预、比较策略、结局、时间范围和研究场景。
- 因果或描述目标:区分病因、预后、诊断、预测、描述和效果评价;观察性研究不得默认作因果解释。
- estimand:写清处理或暴露条件、结局变量、人群、汇总量和需要处理的中间事件。
- 设计与抽样:说明队列、病例对照、横断面、试验、真实世界研究或其他设计为何匹配目标,并描述时间零点、索引日和随访。
- 研究对象与观测结构:确认纳入、排除、分组、对象标识、每对象记录数、结局测量次数、重复记录、聚类单位、失访和分析人群;记录排除顺序及预期样本流。多个暴露或预测时点不得直接解释为重复结局。
- 变量与测量:定义主要和次要终点、暴露、协变量、效应修饰因素、测量时点、单位、编码和数据来源;需要纵向、混合或聚类模型时,写清分析单位、相关结构和随机效应依据。
- 偏倚与混杂:逐项评估选择偏倚、信息偏倚、混杂、时间相关偏倚、缺失和信息泄漏,并把控制措施对应到设计或分析。
- 精度与可行性:根据主要 estimand 给出样本量、事件数或精度依据及全部假设;假设无来源时标为待确认,不编造效应量。
- 分析计划:预设主要模型、效应量、协变量策略、模型诊断、缺失处理、多重性、亚组、敏感性分析和探索边界。
- 伦理、注册、数据权限与报告:记录相应要求、适用报告规范,以及正式版本如何确认和保存。
若分组、终点、纳排、主要 estimand 或主要模型存在多个合理方案,列出差异和影响后向用户确认,不自行选择。
3. 输出
- Q:直接回答当前设计或方法问题,不创建设计备忘录、PROTOCOL、SAP 或项目记录。
- L:只完成用户点名的 estimand、终点、纳排、偏倚、样本量/精度、SAP 条目或其它可定位部件,并核对会直接改变该部件含义的依赖;不强制补齐整份设计。
- 用户要求一份轻量但完整的研究设计咨询时:输出设计备忘录,包含研究问题、estimand、关键定义、偏倚控制、主分析框架、未决事项和可观察验收条件。
- 正式项目:更新
PROTOCOL.md与SAP.md;已确认的方法选择或偏离写入DECISIONS.md,缺失信息写入BACKLOG.md。不改动结果数字唯一来源。 - 用户只要求审查时:按“已明确、证据不足、内部冲突、需用户决定”分类报告,不替用户改文件。
PROTOCOL 与 SAP 的字段规范见 references/protocol-sap-specification.md。
4. 完成条件
- Q 已直接回答当前问题并说明事实或适用边界;L 的目标部件、直接依赖和未决项已核对,范围外设计不声称完成。
- 完整设计任务的研究问题、时间零点、分析人群、主要 estimand 和主要终点可由另一位研究者无歧义复述。
- 完整设计任务中的每个关键变量有来源、定义、单位、时点和编码;复合终点有组成与判定规则。
- 涉及纵向、重复测量或聚类结构时,对象 ID、每对象记录数、结局时点、分析单位、聚类单位和相关结构依据可以无歧义复述。
- 当前范围内的主要偏倚风险有对应控制措施,且未把分析阶段无法补救的问题隐藏起来。
- 当前范围涉及样本量或精度时,假设可追溯,未知项明确标记并停在安全点。
- 当前范围涉及分析计划时,主分析、敏感性分析和探索性分析边界清楚,未根据已见结果倒写为预设。
- 正式项目的 PROTOCOL、SAP、DECISIONS 和 BACKLOG 之间无冲突。