Linglanmidian Systematic Evaluation Tcm

Build rigorous, multi-task evaluation benchmarks for domain-specific LLMs using the LingLanMiDian methodology: synonym-tolerant matching, difficulty-ranked hard subsets, character-level F1, and decision recognition reframing. Trigger phrases: 'evaluate LLM on domain knowledge', 'build a medical benchmark', 'TCM evaluation pipeline', 'synonym-tolerant scoring', 'create hard subset for benchmark', 'domain-specific LLM evaluation'

ndpvt-web 341e219 17.2 KB Updated

File contents

ndpvt-web/arxiv-claude-skills/tree/main/skills/linglanmidian-systematic-evaluation-tcm commit 341e219bc8

Frequently asked questions

npx skillmds@latest add ndpvt-web/linglanmidian-systematic-evaluation-tcm