Duplicate Detector Fuzzy

模糊去重工具。使用标准库相似度匹配检测并处理数据集中的近似重复记录,可发现非完全一致但高度相似的记录。 当用户提到模糊去重、近似重复检测、相似度去重、文本去重等需求时使用此skill。

cas-bigdatalab Updated

File contents

Duplicate Detector Fuzzy 模糊去重 Skill

功能概述

本skill使用标准库相似度算法检测数据集中的近似重复记录。

与精确去重不同,模糊去重可以发现内容高度相似但不完全相同的记录,如:

  • 拼写略微不同的姓名
  • 格式稍有差异的地址
  • 包含少量错别字的文本

保留策略

策略 说明
first 保留第一条记录
last 保留最后一条记录
none 删除所有重复记录
mark 标记重复但不删除

使用方法

python scripts/run_duplicate_detector_fuzzy.py \
  --input data.csv \
  --output deduped.csv \
  --subset "name" \
  --similarity_threshold 0.9

参数说明

参数 必填 说明
--input 输入文件路径
--output 输出文件路径
--subset 比对相似度的文本字段
--similarity_threshold 相似度阈值(0-1),默认0.9
--keep 保留策略,默认"first"

环境要求

pip install pandas openpyxl

cas-bigdatalab/piflow/tree/main/workspace/skills/duplicate_detector_fuzzy commit 98acbeb16c

Frequently asked questions

npx skillmds@latest add cas-bigdatalab/duplicate-detector-fuzzy