翻译分块合并工具
将多个分块的MD翻译文件合并为一本完整的中文书籍。
功能
- 自动扫描排序 - 查找所有分块文件(如chunk001.md, chunk002.md...)并按数字顺序排序
- 页码处理 - 提取页码信息(支持
--- Page N ---格式),去除重复页码 - 翻译修正 - 自动修复常见翻译问题:
- 替换乱码:¥2y→道路, Conse→需求
- 翻译未翻译词汇:delightful→可爱的, pinpoint→精准定位
- 清理多余符号
- 格式统一 - 清理多余的破折号、空格、空行
- 输出报告 - 生成合并统计和缺失页码列表
使用方法
命令行
python merge.py <源文件夹> [输出文件名]
作为Python模块
from merge import merge_translation_chunks
result = merge_translation_chunks(
source_dir="E:\\Books\\translation",
output_filename="完整版.md",
fix_translation=True
)
返回值
{
"success": True,
"output_path": "E:/Books/translation/完整版.md",
"total_pages": 223,
"duplicates_removed": [17, 28, 35],
"missing_pages": [19, 20, 21, 22]
}
依赖
- Python 3.6+
- 仅使用标准库,无需安装额外依赖