Duplicate Detector Fuzzy 模糊去重 Skill
功能概述
本skill使用标准库相似度算法检测数据集中的近似重复记录。
与精确去重不同,模糊去重可以发现内容高度相似但不完全相同的记录,如:
- 拼写略微不同的姓名
- 格式稍有差异的地址
- 包含少量错别字的文本
保留策略
| 策略 | 说明 |
|---|---|
first |
保留第一条记录 |
last |
保留最后一条记录 |
none |
删除所有重复记录 |
mark |
标记重复但不删除 |
使用方法
python scripts/run_duplicate_detector_fuzzy.py \
--input data.csv \
--output deduped.csv \
--subset "name" \
--similarity_threshold 0.9
参数说明
| 参数 | 必填 | 说明 |
|---|---|---|
--input |
是 | 输入文件路径 |
--output |
是 | 输出文件路径 |
--subset |
是 | 比对相似度的文本字段 |
--similarity_threshold |
否 | 相似度阈值(0-1),默认0.9 |
--keep |
否 | 保留策略,默认"first" |
环境要求
pip install pandas openpyxl