bracket_normalizer 括号类型统一Skill
功能概述
将中文/全角括号统一为 ASCII 半角括号:【】〔〕[]→[],「」『』→"",《》〈〉→<>,()⦅⦆→(),{}→{}。
触发条件
- 括号统一 / 全角括号转半角
- 中文括号转换
- 括号规范化
- 括号类符号统一
核心参数说明
必需参数
| 参数 | 说明 |
|---|---|
--input_path |
输入 CSV/TSV/Excel 等结构化文件路径 |
--output_path |
输出清洗后文件路径 |
可选参数
| 参数 | 说明 | 默认值 |
|---|---|---|
--text_columns |
需要处理的文本列,逗号分隔;不填则处理全部字符串列 | 全部字符串列 |
输入文件格式
输入为结构化表格,文本列可包含中文/全角括号:
id,text
1,"【标题】「引用」《书名》(说明)"
支持的文件格式
- CSV (.csv) / TSV (.tsv) / Excel (.xls, .xlsx) / SPSS (.sav)
使用方法
python scripts/bracket_normalizer.py \
--input_path <输入文件> \
--output_path <输出文件> \
[--text_columns col1,col2]
参数说明
| 参数 | 必填 | 说明 |
|---|---|---|
--input_path |
是 | 输入文件路径 |
--output_path |
是 | 输出文件路径 |
--text_columns |
否 | 处理的文本列 |
输出示例
[OK] 括号类型统一完成 -> output.csv
列: ['text'], 映射: 20 对
输入 【重要】「日本語」《タイトル》 → 输出 [重要]"日本語"<タイトル>
环境要求
使用仓库内 Python 环境运行,无额外第三方依赖;读取/写入复用共享 data_io。
注意事项
- 使用 translate 高速 1:1 映射
- 左右括号独立映射,保持配对逻辑
- 中文语境下
「」→""可能改变语义,请确认业务场景