Wikichat Simulated Dialogue Eval

Evaluates the factual accuracy, conversational quality, and latency of knowledge-grounded chatbots in simulated multi-turn dialogues across head, tail, and recent knowledge domains. Use when the user wants to benchmark on Simulated Dialogues (WikiChat), or asks about evaluating this task. Reports factual_accuracy.

qhjqhj00 a92c4e2 2.7 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/wikichat-simulated-dialogue-eval commit a92c4e2682

Frequently asked questions

npx skillmds add qhjqhj00/wikichat-simulated-dialogue-eval