# Duplicate Detector Exact

> 精确去重工具。使用pandas精确匹配检测并处理数据集中的完全重复记录，速度快、无额外依赖。 当用户提到精确去重、完全重复检测、数据去重等需求时使用此skill。

- Skill: `cas-bigdatalab/duplicate-detector-exact` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add cas-bigdatalab/duplicate-detector-exact`
- Raw SKILL.md: https://api.skillmd.com/api/skills/cas-bigdatalab/duplicate-detector-exact/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Data & Analytics
- Author: cas-bigdatalab (https://skillmd.com/u/cas-bigdatalab)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/cas-bigdatalab/duplicate-detector-exact

---


# Duplicate Detector Exact 精确去重 Skill

## 功能概述

本skill用于检测和处理数据集中的完全重复记录，基于pandas的精确匹配：
- **全字段匹配**：所有列完全相同的记录
- **指定字段匹配**：只比较指定的字段

## 保留策略

| 策略 | 说明 |
|------|------|
| `first` | 保留第一条重复记录 |
| `last` | 保留最后一条重复记录 |
| `none` | 删除所有重复记录 |
| `mark` | 标记重复但不删除（添加is_duplicate列） |

## 使用方法

### 全字段去重
```bash
python scripts/run_duplicate_detector_exact.py \
  --input data.csv \
  --output deduped.csv
```

### 按指定字段去重
```bash
python scripts/run_duplicate_detector_exact.py \
  --input data.csv \
  --output deduped.csv \
  --subset "name,phone"
```

### 标记重复
```bash
python scripts/run_duplicate_detector_exact.py \
  --input data.csv \
  --output marked.csv \
  --keep mark
```

## 参数说明

| 参数 | 必填 | 说明 |
|------|------|------|
| `--input` | 是 | 输入文件路径 |
| `--output` | 是 | 输出文件路径 |
| `--subset` | 否 | 判断重复的字段，逗号分隔 |
| `--keep` | 否 | 保留策略，默认"first" |

## 环境要求

```bash
pip install pandas openpyxl
```

