PDF para MD
Converter arquivos PDF em Markdown usando script local e padronizar saida para leitura e edicao.
Fluxo
- Receber caminho do PDF de entrada.
- Rodar
scripts/pdf_to_md.pypara extrair texto por pagina. - Aplicar limpeza basica para Markdown legivel.
- Entregar arquivo
.mdfinal e validar resultado.
Como Executar
python "C:/Users/Lucas/.codex/skills/pdf-para-md/scripts/pdf_to_md.py" "C:/caminho/arquivo.pdf"
Opcionalmente definir saida:
python "C:/Users/Lucas/.codex/skills/pdf-para-md/scripts/pdf_to_md.py" "C:/caminho/arquivo.pdf" -o "C:/caminho/saida.md"
Comportamento do Script
- Tenta extracao com
PyMuPDF, depoispdfplumber, depoispypdf. - Inclui marcacao de pagina no Markdown:
<!-- page N -->. - Faz limpeza de quebras de linha e hifenizacao.
- Detecta titulos obvios e converte para
##quando apropriado.
Qualidade e Limites
- PDFs digitalizados por imagem podem exigir OCR externo para melhor resultado.
- Tabelas complexas podem perder estrutura; revisar manualmente depois da conversao.
- Sempre revisar o
.mdfinal antes de uso em producao.
Dependencias
Instalar ao menos uma biblioteca de extracao:
pip install pymupdf
Alternativas:
pip install pdfplumber
pip install pypdf