Pretraining Data Tokenizers

World-class guidance for building petabyte-scale LLM pretraining-data pipelines and the tokenizers that sit in front of them — the curation and vocabulary decisions that quietly set model quality and serving cost. Use when curating web-scale corpora (Common Crawl / WARC extraction, language ID, quality filtering, dedup, decontamination), deciding data mixtures/curricula/repetition, or designing/evaluating a tokenizer (BPE/Unigram/WordPiece, byte-level BPE, SentencePiece/tiktoken/HF tokenizers, vocab size, fertility/tokens-per-word, multilingual & code). Covers FineWeb/FineWeb-Edu, RefinedWeb, CCNet, DataComp-LM, Dolma, The Pile, MinHash-LSH dedup, datatrove/Spark/Ray at scale, and the anti-patterns (no dedup, benchmark contamination, language-blind filtering, high-fertility tokenizers, no provenance) that waste compute and leak evals.

sanjeevrg89 ecfe452 5 files · 42.9 KB Updated

File contents

sanjeevrg89/arete/tree/main/skills/pretraining-data-tokenizers commit ecfe45263b

Frequently asked questions

npx skillmds@latest add sanjeevrg89/pretraining-data-tokenizers