Summarization Metrics Eval

Evaluates the correlation between automatic summarization metrics and LLM-as-a-Judge models against human judgments across five quality criteria (coherence, consistency, fluency, relevance, 5W1H) in Spanish and Basque. Use when the user wants to benchmark on BASSE, or asks about evaluating this task. Reports Spearman's $ ho$.

qhjqhj00 420e448 3.5 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/summarization-metrics-eval commit 420e448e7e

Frequently asked questions

npx skillmds add qhjqhj00/summarization-metrics-eval