Human Feedback Summarization Eval

Evaluates abstractive summarization quality by measuring human preference over reference summaries and rating outputs across coverage, accuracy, coherence, and overall quality. It also benchmarks how well learned reward models and automatic metrics correlate with human judgments. Use when the user wants to benchmark on Reddit TL;DR, CNN/DailyMail, or asks about evaluating this task. Reports preference score.

qhjqhj00 21491d4 3.3 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/human-feedback-summarization-eval commit 21491d4a77

Frequently asked questions

npx skillmds add qhjqhj00/human-feedback-summarization-eval