PDF Processor

PDF Processor Skill

GSkuza f5de147 2 files · 930 B Updated

File contents

PDF Processor Skill

Skill Name

pdf-processor

Description

Skill for processing and extracting text from PDF files, with support for Polish language and diacritical characters.

Capabilities

  • Extracting text from PDF files
  • OCR support for scanned documents
  • Detecting Polish diacritical characters
  • Text cleaning and normalization

Usage

skill: pdf-processor
options:
  ocr: true
  language: "pol"
  output-format: "markdown"
  preserve-layout: false

Scripts

  • scripts/extract.py - Main PDF extraction script
  • scripts/clean.py - Text cleaning utilities

Output

Returns cleaned text in Markdown or plain text format.

GSkuza/ai-polish-text-expert/tree/main/ai-polish-text-expert-plugin/skills/pdf-processor commit f5de14787a

Frequently asked questions

npx skillmds@latest add gskuza/pdf-processor