Sentencepiece

Tokenizador agnóstico de linguagem que trata texto como Unicode bruto. Suporta algoritmos BPE e Unigram. Rápido (50k sentenças/seg), leve (6MB de memória), vocabulário determinístico. Usado por T5, ALBERT, XLNet, mBART. Treina em texto bruto sem pré-tokenização. Use quando você precisar de suporte multilíngue, linguagens CJK ou tokenização reproduzível.

artubss Updated 10 repo stars

File contents

artubss/SKILLS-CLAUDE-CODE/tree/main/skills/skills/ai-research/tokenization-sentencepiece commit 8821a1ec1f

Frequently asked questions

npx skillmds@latest add artubss/sentencepiece