# Research Output Evaluation

> **关键洞察**：98篇论文中，真正接近可发表水平的（T1+T2且D10a≥95%）约10-15篇。其中使用真实临床数据的可能不到5篇。其余80+篇需要大量修订或归档。

- Skill: `yakeworld/research-output-evaluation` (Agent Skill, multi-file: 7 files)
- Install (CLI): `npx skillmds@latest add yakeworld/research-output-evaluation`
- Raw SKILL.md: https://api.skillmd.com/api/skills/yakeworld/research-output-evaluation/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Research & Search
- License: MIT
- Author: yakeworld (https://skillmd.com/u/yakeworld)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/yakeworld/research-output-evaluation

---


-|
| 总论文目录数 | 98 |
| 有.tex的论文 | 71 |
| 有PDF的论文 | 59 |
| 有quality_score的论文 | 88 |
| 质量门PASS | 19 (21.6%) |
| 质量门CONDITIONAL | 49 (55.7%) |
| 质量门FAIL | 21 (23.9%) |
| 质量分中位数 | 55 |
| 质量分均值 | 55.3 |
| 质量分最高 | 96 (7篇) |
| T1 (≥90) | 32 |
| T2 (70-89) | 94 |
| T3 (50-69) | 4 |
| T4 (<50) | 2 |
| 已完成论文 | 56 |
| 僵尸引用总数 | 1063 |
| D8≥30的论文 | 29.9% |
| D10a≥95%的论文 | 91.6% |

**关键洞察**：98篇论文中，真正接近可发表水平的（T1+T2且D10a≥95%）约10-15篇。其中使用真实临床数据的可能不到5篇。其余80+篇需要大量修订或归档。

## 契约层 · BOUNDARY

**边界**：技能功能边界。

## 契约层 · IO_CONTRACT

**输入**：请求描述、上下文信息。
**输出**：执行结果、状态反馈。

## 验证清单 · VERIFICATION

- [ ] 评估采用多维指标交叉验证（质量门状态 × T1/T2 等级 × D10a 覆盖率），未依赖单一分数下结论（RESE-001）
- [ ] 可发表潜力判定使用严格复合阈值（T1+T2 且 D10a≥95%），输出被过滤出的核心资产清单及其占比（RESE-002）
- [ ] 每个低质量/僵尸产出均有明确处置分类（"需大量修订" vs "直接归档"），无模糊地带（RESE-003）
- [ ] 所有评估数字（论文总数、质量门 PASS/CONDITIONAL/FAIL 分布、D10a≥95% 比例等）可追溯到具体数据源，无编造或推测（RESE-004）
- [ ] 评估流程（统计口径、阈值、分类规则）完整记录，可被独立重复执行并复现相同结果（RESE-005）
- [ ] 缺失输入（无 .tex / 无 PDF / 无 quality_score 的论文）被显式识别并单独统计，不混入主分布
- [ ] 僵尸引用（如 1063 例）被单独计数并归属到论文，不折叠进质量分均值
- [ ] 评估结论区分"事实"（数据实测）与"推断"（如"真实临床数据论文 <5 篇"的估计），推断处标注不确定性

## 核心原则 · PRINCIPLES

1. **准确为先**: 所有输出必须经过事实核查，不编造数据
2. **证据驱动**: 每个结论必须可追溯到具体证据或数据源
3. **可复现性**: 每一步操作必须可重复，结果可验证

## 约束规则 · RULES

1. **输入约束**: 参数类型、范围、格式必须校验
2. **输出约束**: 返回值结构、编码、命名必须一致
3. **异常约束**: 错误信息必须包含上下文和恢复建议
4. **安全约束**: 不执行未验证的任意代码，不暴露内部状态

## Golden 集合 · GOLDEN SET

- **Golden Input**: 98 篇论文目录（.tex 71 篇、PDF 59 篇、quality_score 88 篇），含每篇质量门状态、质量分、T 等级、D10a 覆盖率、僵尸引用数
- **Golden Output**: 多维交叉验证报告：质量门分布 PASS 19 (21.6%) / CONDITIONAL 49 (55.7%) / FAIL 21 (23.9%)，缺失项（98−71=27 无 .tex 等）单独统计；复合阈值「T1+T2 且 D10a≥95%」过滤出约 10–15 篇核心资产；僵尸引用 1063 例逐一归属；「真实临床数据论文 <5 篇」标注为推断
- **Golden Error**: 依赖单一质量分下结论、僵尸引用 1063 例折叠进质量分均值、低质量产出未区分「需大量修订」/「直接归档」、或任一数字无法追溯到具体数据源（违反 RESE-004）

> Golden 集合是测试的单一真理来源。所有改进必须通过 golden 测试。

> 违反规则的操作视为不安全，必须拒绝或隔离。

> 违反任何原则的输出视为失败。原则优先级：准确 > 证据 > 可复现。

> 每项验证必须可执行、可记录、可复现。验证失败时记录原因和修复。

# Research Output Evaluation---

## Genes (策略基因)
> 紧凑策略表示。条件→策略。需要深度时参考完整文档。
- **[RESE-007]** 评估研究产出整体质量时 → 采用多维指标（如质量门状态、D10a覆盖率、T1/T2等级）交叉验证，而非依赖单一分数
- **[RESE-008]** 识别可发表潜力论文时 → 设定严格复合阈值（如 T1+T2 且 D10a≥95%），以过滤出真正接近发表水平的少数核心资产
- **[RESE-009]** 处理大量低质量或僵尸产出时 → 明确区分“需大量修订”与“直接归档”的界限，避免资源浪费在不可救回的样本上
- **[RESE-010]** 生成评估结论时 → 确保每个判断可追溯至具体数据源或证据，严禁编造或推测未验证的数据
- **[RESE-011]** 执行评估流程时 → 保证每一步操作的可复现性，使结果可被独立验证和重复执行
- **[RESE-012]** 面对输入参数或文件缺失时 → 执行严格的输入校验（类型、范围、格式），并在异常时提供包含上下文和恢复建议的错误信息

## 示例 · EXAMPLES

> 基于本技能 Genes / VERIFICATION / 关键洞察真实数据构造的语义化示例。

1. **多维交叉验证质量**（RESE-001 / VERIFICATION #1）
   输入：98 篇论文目录，含 .tex 71 篇、有 PDF 59 篇、有 quality_score 88 篇。
   操作：对每篇交叉验证质量门状态 × T1/T2 等级 × D10a 覆盖率，不依赖单一分数；缺失 .tex/PDF/quality_score 者显式识别并单独统计（如 98−71=27 无 .tex）。
   验证：缺失项单独计数、不混入主分布；质量门分布可复算 PASS 19 (21.6%) / CONDITIONAL 49 (55.7%) / FAIL 21 (23.9%)，与数据源一致（RESE-004）。

2. **严格复合阈值过滤可发表潜力**（RESE-002 / VERIFICATION #2 / 关键洞察）
   输入：T1(≥90) 32 篇 + T2(70–89) 94 篇候选池，D10a≥95% 占 91.6%。
   操作：施加复合阈值「T1+T2 且 D10a≥95%」，过滤出真正接近发表水平的核心资产清单并计算占比。
   验证：核心资产约 10–15 篇（占 98 篇的少数）；「其中使用真实临床数据的可能不到 5 篇」标注为推断并附不确定性（VERIFICATION #8：区分事实与推断）。

3. **低质量/僵尸产出处置分类**（RESE-003 / VERIFICATION #3、#7）
   输入：质量门 FAIL 21 篇 + 僵尸引用总数 1063 例。
   操作：对每篇低质量产出明确分类为「需大量修订」或「直接归档」；僵尸引用单独计数并归属到具体论文，不折叠进质量分均值。
   验证：1063 例僵尸引用逐一归属到论文、无折叠；21 篇 FAIL 论文各带处置标签、无模糊地带；结论数字可追溯到具体数据源（RESE-004）。
