Español — Versión oficial en español de
document-chunker.
Document Chunker (Español)
Divide documentos en fragmentos de tokens superpuestos. Optimizado para pipelines RAG y ventanas de contexto de LLM. Cero dependencias: solo stdlib de Python + re.
Uso
Como biblioteca
from document_chunker import DocumentChunker
chunker = DocumentChunker(chunk_size=400, overlap=80)
chunks = chunker.chunk_text("Long text...")
for chunk in chunks:
print(f"Chunk {chunk['chunk_id']}: {chunk['tokens']} tokens")
Fragmentar un archivo
chunks = chunker.chunk_document("document.md", source="My Project")
Fragmentar un directorio completo
from document_chunker import chunk_corpus
chunks = chunk_corpus(["doc1.md", "doc2.txt"], source="Corpus")
CLI
python document_chunker.py document.md # Single file
python document_chunker.py ./docs/ # Entire directory
Parámetros
| Parámetro | Por defecto | Descripción |
|---|---|---|
| chunk_size | 400 | Máximo de tokens por fragmento |
| overlap | 80 | Tokens de superposición entre fragmentos |
Tipos de archivo soportados
.txt, .md, .py, .sh
Registro de cambios
1.0.0 (2026-03-12)
- Adaptado desde BACH system/tools/document_chunker.py