# Document Chunker

> Разбиение документов на перекрывающиеся фрагменты токенов для RAG-конвейеров и контекстных окон LLM. Нулевые зависимости.

- Skill: `ellmos-ai/document-chunker-5` (Agent Skill)
- Install (CLI): `npx skillmds@latest add ellmos-ai/document-chunker-5`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ellmos-ai/document-chunker-5/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: ellmos-ai (https://skillmd.com/u/ellmos-ai)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/ellmos-ai/document-chunker-5

---


<img src="banner.png" width="100%" alt="document-chunker banner">

> **Русский** — Официальная русская версия `document-chunker`.


# Document Chunker (Русский)

Разбивает документы на перекрывающиеся фрагменты (чанки) токенов. Оптимизировано для RAG-конвейеров
и контекстных окон LLM. Нулевые зависимости — только стандартная библиотека Python + re.

## Использование

### Как библиотека
```python
from document_chunker import DocumentChunker

chunker = DocumentChunker(chunk_size=400, overlap=80)
chunks = chunker.chunk_text("Long text...")

for chunk in chunks:
    print(f"Chunk {chunk['chunk_id']}: {chunk['tokens']} tokens")
```

### Разбиение файла
```python
chunks = chunker.chunk_document("document.md", source="My Project")
```

### Разбиение всего каталога
```python
from document_chunker import chunk_corpus

chunks = chunk_corpus(["doc1.md", "doc2.txt"], source="Corpus")
```

### CLI
```bash
python document_chunker.py document.md    # Single file
python document_chunker.py ./docs/        # Entire directory
```

## Параметры

| Параметр | По умолчанию | Описание |
|-----------|--------------|----------|
| chunk_size | 400 | Макс. токенов в фрагменте |
| overlap | 80 | Перекрывающиеся токены между фрагментами |

## Поддерживаемые типы файлов

`.txt`, `.md`, `.py`, `.sh`

## Журнал изменений

### 1.0.0 (2026-03-12)
- Перенесено из BACH system/tools/document_chunker.py

