# Document Chunker

> Divide documentos en fragmentos de tokens superpuestos para pipelines RAG y ventanas de contexto LLM. Cero dependencias.

- Skill: `ellmos-ai/document-chunker-3` (Agent Skill)
- Install (CLI): `npx skillmds@latest add ellmos-ai/document-chunker-3`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ellmos-ai/document-chunker-3/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: ellmos-ai (https://skillmd.com/u/ellmos-ai)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/ellmos-ai/document-chunker-3

---


<img src="banner.png" width="100%" alt="document-chunker banner">

> **Español** — Versión oficial en español de `document-chunker`.


# Document Chunker (Español)

Divide documentos en fragmentos de tokens superpuestos. Optimizado para pipelines RAG
y ventanas de contexto de LLM. Cero dependencias: solo stdlib de Python + re.

## Uso

### Como biblioteca
```python
from document_chunker import DocumentChunker

chunker = DocumentChunker(chunk_size=400, overlap=80)
chunks = chunker.chunk_text("Long text...")

for chunk in chunks:
    print(f"Chunk {chunk['chunk_id']}: {chunk['tokens']} tokens")
```

### Fragmentar un archivo
```python
chunks = chunker.chunk_document("document.md", source="My Project")
```

### Fragmentar un directorio completo
```python
from document_chunker import chunk_corpus

chunks = chunk_corpus(["doc1.md", "doc2.txt"], source="Corpus")
```

### CLI
```bash
python document_chunker.py document.md    # Single file
python document_chunker.py ./docs/        # Entire directory
```

## Parámetros

| Parámetro | Por defecto | Descripción |
|-----------|-------------|-------------|
| chunk_size | 400 | Máximo de tokens por fragmento |
| overlap | 80 | Tokens de superposición entre fragmentos |

## Tipos de archivo soportados

`.txt`, `.md`, `.py`, `.sh`

## Registro de cambios

### 1.0.0 (2026-03-12)
- Adaptado desde BACH system/tools/document_chunker.py

