Markitdown Ocr

引导 LLM 通过 `markitdown-ocr` 插件(官方插件仓库 microsoft/markitdown/packages/markitdown-ocr)使用 LLM Vision(OpenAI 兼容模型,如 gpt-4o / Azure OpenAI / Gemini / 其它 OpenAI 兼容服务)对 PDF / DOCX / PPTX / XLSX 内嵌图片与扫描页进行 OCR 文本抽取。覆盖安装、配置(`OPENAI_API_KEY` / Azure 凭据 / 自定义 endpoint)、Python API 与 CLI 包装、扫描 PDF 的全页渲染回退、各格式 OCR 行为差异(行内插入 / 表格后追加 / 顶层描述)、自定义 prompt、成本/限制排错。当用户问"扫描 PDF 怎么转 markdown"、"PPT 里图片的文字怎么抽出来"、"怎么用 GPT-4o 做 OCR"、"markitdown-ocr 插件怎么装"、"Azure OpenAI 怎么配 markitdown"时使用本 skill;若只是普通 CLI 用法或 MarkItDown 概览,跳到兄弟 skill `markitdown-cli` 与 `markitdown-awesome`。

full-stack-skills 4545a39 7 files · 34.0 KB Updated

File contents

full-stack-skills/document-skills/tree/main/skills/markitdown-ocr commit 4545a39235

Frequently asked questions

npx skillmds@latest add full-stack-skills/markitdown-ocr