Doc Extract

Corpus-agnostic примитивы для извлечения plain text из документов: PDF (text layer + scan detect), сканированный PDF через OCR (PyMuPDF + Tesseract rus+eng), legacy Office (.doc/.ppt/.rtf через LibreOffice), .pptx, .csv, spreadsheets (.xls/.xlsx). Importable-функции, своего корпуса нет. Use when a pipeline needs arbitrary office/PDF → text и базового docx/txt/md-экстрактора `docs-rag` не хватает.

VibeEngineering-LLC 801e68d 4 files · 19.2 KB Updated

File contents

VibeEngineering-LLC/agent-ops-doctrine/tree/main/skills/doc-extract commit 801e68d9d1

Frequently asked questions

npx skillmds@latest add vibeengineering-llc/doc-extract