Русский — Официальная русская версия
document-chunker.
Document Chunker (Русский)
Разбивает документы на перекрывающиеся фрагменты (чанки) токенов. Оптимизировано для RAG-конвейеров и контекстных окон LLM. Нулевые зависимости — только стандартная библиотека Python + re.
Использование
Как библиотека
from document_chunker import DocumentChunker
chunker = DocumentChunker(chunk_size=400, overlap=80)
chunks = chunker.chunk_text("Long text...")
for chunk in chunks:
print(f"Chunk {chunk['chunk_id']}: {chunk['tokens']} tokens")
Разбиение файла
chunks = chunker.chunk_document("document.md", source="My Project")
Разбиение всего каталога
from document_chunker import chunk_corpus
chunks = chunk_corpus(["doc1.md", "doc2.txt"], source="Corpus")
CLI
python document_chunker.py document.md # Single file
python document_chunker.py ./docs/ # Entire directory
Параметры
| Параметр | По умолчанию | Описание |
|---|---|---|
| chunk_size | 400 | Макс. токенов в фрагменте |
| overlap | 80 | Перекрывающиеся токены между фрагментами |
Поддерживаемые типы файлов
.txt, .md, .py, .sh
Журнал изменений
1.0.0 (2026-03-12)
- Перенесено из BACH system/tools/document_chunker.py