-| | 总论文目录数 | 98 | | 有.tex的论文 | 71 | | 有PDF的论文 | 59 | | 有quality_score的论文 | 88 | | 质量门PASS | 19 (21.6%) | | 质量门CONDITIONAL | 49 (55.7%) | | 质量门FAIL | 21 (23.9%) | | 质量分中位数 | 55 | | 质量分均值 | 55.3 | | 质量分最高 | 96 (7篇) | | T1 (≥90) | 32 | | T2 (70-89) | 94 | | T3 (50-69) | 4 | | T4 (<50) | 2 | | 已完成论文 | 56 | | 僵尸引用总数 | 1063 | | D8≥30的论文 | 29.9% | | D10a≥95%的论文 | 91.6% |
关键洞察:98篇论文中,真正接近可发表水平的(T1+T2且D10a≥95%)约10-15篇。其中使用真实临床数据的可能不到5篇。其余80+篇需要大量修订或归档。
契约层 · BOUNDARY
边界:技能功能边界。
契约层 · IO_CONTRACT
输入:请求描述、上下文信息。 输出:执行结果、状态反馈。
验证清单 · VERIFICATION
- 评估采用多维指标交叉验证(质量门状态 × T1/T2 等级 × D10a 覆盖率),未依赖单一分数下结论(RESE-001)
- 可发表潜力判定使用严格复合阈值(T1+T2 且 D10a≥95%),输出被过滤出的核心资产清单及其占比(RESE-002)
- 每个低质量/僵尸产出均有明确处置分类("需大量修订" vs "直接归档"),无模糊地带(RESE-003)
- 所有评估数字(论文总数、质量门 PASS/CONDITIONAL/FAIL 分布、D10a≥95% 比例等)可追溯到具体数据源,无编造或推测(RESE-004)
- 评估流程(统计口径、阈值、分类规则)完整记录,可被独立重复执行并复现相同结果(RESE-005)
- 缺失输入(无 .tex / 无 PDF / 无 quality_score 的论文)被显式识别并单独统计,不混入主分布
- 僵尸引用(如 1063 例)被单独计数并归属到论文,不折叠进质量分均值
- 评估结论区分"事实"(数据实测)与"推断"(如"真实临床数据论文 <5 篇"的估计),推断处标注不确定性
核心原则 · PRINCIPLES
- 准确为先: 所有输出必须经过事实核查,不编造数据
- 证据驱动: 每个结论必须可追溯到具体证据或数据源
- 可复现性: 每一步操作必须可重复,结果可验证
约束规则 · RULES
- 输入约束: 参数类型、范围、格式必须校验
- 输出约束: 返回值结构、编码、命名必须一致
- 异常约束: 错误信息必须包含上下文和恢复建议
- 安全约束: 不执行未验证的任意代码,不暴露内部状态
Golden 集合 · GOLDEN SET
- Golden Input: 98 篇论文目录(.tex 71 篇、PDF 59 篇、quality_score 88 篇),含每篇质量门状态、质量分、T 等级、D10a 覆盖率、僵尸引用数
- Golden Output: 多维交叉验证报告:质量门分布 PASS 19 (21.6%) / CONDITIONAL 49 (55.7%) / FAIL 21 (23.9%),缺失项(98−71=27 无 .tex 等)单独统计;复合阈值「T1+T2 且 D10a≥95%」过滤出约 10–15 篇核心资产;僵尸引用 1063 例逐一归属;「真实临床数据论文 <5 篇」标注为推断
- Golden Error: 依赖单一质量分下结论、僵尸引用 1063 例折叠进质量分均值、低质量产出未区分「需大量修订」/「直接归档」、或任一数字无法追溯到具体数据源(违反 RESE-004)
Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。
违反规则的操作视为不安全,必须拒绝或隔离。
违反任何原则的输出视为失败。原则优先级:准确 > 证据 > 可复现。
每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。
Research Output Evaluation---
Genes (策略基因)
紧凑策略表示。条件→策略。需要深度时参考完整文档。
- [RESE-007] 评估研究产出整体质量时 → 采用多维指标(如质量门状态、D10a覆盖率、T1/T2等级)交叉验证,而非依赖单一分数
- [RESE-008] 识别可发表潜力论文时 → 设定严格复合阈值(如 T1+T2 且 D10a≥95%),以过滤出真正接近发表水平的少数核心资产
- [RESE-009] 处理大量低质量或僵尸产出时 → 明确区分“需大量修订”与“直接归档”的界限,避免资源浪费在不可救回的样本上
- [RESE-010] 生成评估结论时 → 确保每个判断可追溯至具体数据源或证据,严禁编造或推测未验证的数据
- [RESE-011] 执行评估流程时 → 保证每一步操作的可复现性,使结果可被独立验证和重复执行
- [RESE-012] 面对输入参数或文件缺失时 → 执行严格的输入校验(类型、范围、格式),并在异常时提供包含上下文和恢复建议的错误信息
示例 · EXAMPLES
基于本技能 Genes / VERIFICATION / 关键洞察真实数据构造的语义化示例。
多维交叉验证质量(RESE-001 / VERIFICATION #1) 输入:98 篇论文目录,含 .tex 71 篇、有 PDF 59 篇、有 quality_score 88 篇。 操作:对每篇交叉验证质量门状态 × T1/T2 等级 × D10a 覆盖率,不依赖单一分数;缺失 .tex/PDF/quality_score 者显式识别并单独统计(如 98−71=27 无 .tex)。 验证:缺失项单独计数、不混入主分布;质量门分布可复算 PASS 19 (21.6%) / CONDITIONAL 49 (55.7%) / FAIL 21 (23.9%),与数据源一致(RESE-004)。
严格复合阈值过滤可发表潜力(RESE-002 / VERIFICATION #2 / 关键洞察) 输入:T1(≥90) 32 篇 + T2(70–89) 94 篇候选池,D10a≥95% 占 91.6%。 操作:施加复合阈值「T1+T2 且 D10a≥95%」,过滤出真正接近发表水平的核心资产清单并计算占比。 验证:核心资产约 10–15 篇(占 98 篇的少数);「其中使用真实临床数据的可能不到 5 篇」标注为推断并附不确定性(VERIFICATION #8:区分事实与推断)。
低质量/僵尸产出处置分类(RESE-003 / VERIFICATION #3、#7) 输入:质量门 FAIL 21 篇 + 僵尸引用总数 1063 例。 操作:对每篇低质量产出明确分类为「需大量修订」或「直接归档」;僵尸引用单独计数并归属到具体论文,不折叠进质量分均值。 验证:1063 例僵尸引用逐一归属到论文、无折叠;21 篇 FAIL 论文各带处置标签、无模糊地带;结论数字可追溯到具体数据源(RESE-004)。