DOCX Text Extract

从DOCX文件中提取文本内容

cas-bigdatalab 6fa9712 3 files · 4.5 KB Updated

File contents

docx_text_extract 技能

功能说明

该技能从DOCX文件中提取纯文本内容,保存为txt文件,适用于需要提取文档文本进行分析或处理的场景。

核心功能

  • 提取DOCX中的文本内容
  • 保持段落结构
  • 支持UTF-8编码
  • 自动创建输出目录

使用方法

python scripts/run_docx_text_extract.py --input_path <输入DOCX> --output_path <输出TXT>

参数说明

参数 类型 必填 默认值 说明
input_path string - 输入DOCX文件路径
output_path string - 输出TXT文件路径

示例

python scripts/run_docx_text_extract.py --input_path document.docx --output_path text.txt

注意事项

  • 输出目录不存在时会自动创建
  • 提取的文本会保持段落分隔
  • 不支持提取图片中的文字(如需请使用OCR工具)
  • 如果DOCX文件损坏或不是标准格式,可能提取失败

cas-bigdatalab/piflow/tree/main/workspace/skills/docx_text_extract commit 6fa9712a64

Frequently asked questions

npx skillmds@latest add cas-bigdatalab/docx-text-extract