# PDF Text Extractor Best Practices

> Sub-skill of pdf-text-extractor: Best Practices.

- Skill: `vamseeachanta/pdf-text-extractor-best-practices` (Agent Skill)
- Install (CLI): `npx skillmds@latest add vamseeachanta/pdf-text-extractor-best-practices`
- Raw SKILL.md: https://api.skillmd.com/api/skills/vamseeachanta/pdf-text-extractor-best-practices/raw
- Safety review: PASS (external: skill-scanner PASS, skillspector PASS)
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Docs & Writing
- Author: vamseeachanta (https://skillmd.com/u/vamseeachanta)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/vamseeachanta/pdf-text-extractor-best-practices

---


# Best Practices

## Best Practices


1. **Use timeout for SQLite** - `timeout=30` prevents lock errors
2. **Batch commits** - Commit every 100 files, not every file
3. **Handle errors gracefully** - Log and continue on failures
4. **Track progress** - Enable resumption of interrupted jobs
5. **Chunk appropriately** - 1500-2500 chars optimal for search
6. **Preserve page numbers** - Essential for citations

