石墨格式清洗
前置条件
- 已安装 Python 依赖:
pip3 install python-docx
清洗规则(6条)
- "讲解过程与可视化建议"之前的所有内容全部删除
- 保留所有标题(按文档原有层级)
- 按顺序和分段,保留所有绿色高亮文字
- 删除所有:图片、链接、可视化建议段落、标签需求段落
- 删除"交互探究"标题及其后整个表格
- 删除"大总结"标题及其后整个表格
石墨 Word 导出格式说明
石墨导出 Word 文档时的格式特点(已通过逆向分析确认):
- 标题:段落 pStyle =
shimo heading 1/2/3(非标准 Word Heading 样式,python-docx 的.style.name无法读取,需直接读取 XML 的w:pStyle) - 绿色高亮文字:存放在单列表格(table)的第一个 cell 中,run 级别带有
w:highlight val="yellow"。注意:石墨绿色 = Word yellow - 可视化建议/参考链接等:同一表格第一列中无 yellow highlight 的段落,自动排除
- 交互探究/大总结:heading 1 级别标题,其对应的"交互形式"表格无 yellow highlight(自动排除),但交互探究内的讲解内容表格有 yellow highlight(应保留)
工作流程
步骤 1:导出 Word 文件
自动化导出(浏览器工具)
1. browser_navigate 打开石墨链接
2. browser_lock 锁定浏览器
3. 等待页面加载(sleep 3-4秒)
4. 点击右上角"···"圆形按钮(注意:该按钮在固定头部,可能需要先 browser_unlock 让用户手动点击)
5. 悬停"下载" → 点击"Word"
6. 等待 3-5 秒下载完成
7. browser_unlock 解锁浏览器
手动导出(推荐,更可靠)
提示用户:
请在石墨文档中点击右上角"···"圆形按钮 → 下载 → Word,下载完成后告知文件名。
下载后文件保存在 ~/Downloads/[文档标题].docx,用以下命令确认:
ls -t ~/Downloads/*.docx | head -3
步骤 2:运行清洗脚本
# 安装依赖(首次使用)
pip3 install python-docx -q
# 运行脚本
python3 "/Users/liuguangyu/Desktop/A-工作/.cursor/skills/shimo-format-cleaner/scripts/clean_outline.py" \
"/Users/liuguangyu/Downloads/[文件名].docx" \
"/Users/liuguangyu/Desktop/A-工作/03-9+已有内容/[主题名]/04-大纲终稿/[文件名]-清洗.md"
步骤 3:确认输出
读取输出的 .md 文件,向用户确认:
- 标题层级结构是否正确
- 绿色高亮文字是否保留完整
- 需要删除的内容(可视化建议、链接、探究表格)是否已清除
输出路径规则
03-9+已有内容/[主题名]/04-大纲终稿/[文档标题]-清洗.md
示例:
03-9+已有内容/脑科学/04-大纲终稿/E03-神经元-清洗.md
故障排查
找不到绿色高亮内容(输出为空): 可能原因:
- 石墨文档格式不同(非标准大纲格式)
- 运行
--debug参数查看段落颜色信息:python3 clean_outline.py [docx] --debug
找不到"讲解过程与可视化建议": 文档标题措辞可能略有不同,脚本会从头处理并提示警告。
下载的文件找不到:
ls -t ~/Downloads/*.docx | head -5