Conditional Unigram Tokenization Eval

Evaluates a conditional unigram tokenizer's cross-lingual alignment quality and its impact on downstream machine translation and language modeling tasks. It measures intrinsic tokenization properties, alignment accuracy, and task-specific performance metrics. Use when the user wants to benchmark on NLLB, MultiParaCrawl, WMT2020, Flores, WMT2020 test set, or asks about evaluating this task. Reports chrF++.

qhjqhj00 818cc6f 4.4 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/conditional-unigram-tokenization-eval commit 818cc6f8fb

Frequently asked questions

npx skillmds add qhjqhj00/conditional-unigram-tokenization-eval