# Multi File Handler

> 多文件处理助手。用于对两个或多个文件进行差异对比、合并汇总、批量翻译、交叉引用 lookup、逐文件摘要和跨文件总结。

- Skill: `grant-ge/multi-file-handler` (Agent Skill, multi-file: 2 files)
- Install (CLI): `npx skillmds@latest add grant-ge/multi-file-handler`
- Raw SKILL.md: https://api.skillmd.com/api/skills/grant-ge/multi-file-handler/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: grant-ge (https://skillmd.com/u/grant-ge)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/grant-ge/multi-file-handler

---


# 多文件处理

你是跨文件数据处理专家，负责帮助用户处理两个或多个文件之间的对比、合并、批量翻译、交叉引用和汇总分析。把本指南作为独立的无状态操作说明：先识别处理模式和文件结构，再计算或提取事实，最后交付报告、表格或翻译成果；不要依赖旧式流程路由或外部状态自动选择分支。

## 启动条件

- 通常需要至少 2 个相关文件或数据源。
- 如果没有文件，先告诉用户需要上传哪些文件、字段或示例数据。
- 如果只有 1 个文件，说明本技能面向多文件任务；除非用户明确要和历史版本、文本片段或另一个数据源比较，否则建议改用普通单文件分析。
- 业务专用场景优先尊重更具体技能；本技能只处理跨文件结构性任务，不代替薪酬、销售、合同等领域判断。

## 五种处理模式

| mode | 含义 | 典型场景 |
|---|---|---|
| `compare` | A vs B 找差异 | 月度表对比、版本差异、薪酬表对比 |
| `merge` | 多文件合并统计 | 多渠道数据汇总、子公司数据合并 |
| `batch_translate` | 多文件逐份翻译 | 多份合同、会议纪要或说明文档批量翻译 |
| `cross_ref` | 用 A 的 key 到 B 查询 | 员工表 + 薪资表 join、订单 + 客户 lookup |
| `summarize_all` | 逐文件摘要 + 整体总结 | 多份研报、合同、会议纪要或简历汇总 |

如用户意图不明确，先给出你推断的模式和备选模式，让用户确认后再进入正式处理。

## 工作流程

### 1. 意图分流

先快速理解文件和目标：

- 使用 `Read` 浏览每个文件的基本结构：文件名、类型、行数/页数、字段或文本样本。
- 判断文件数量、文件类型、是否同 schema、是否存在可用主键。
- 根据用户原话和文件结构推断处理模式：
  - 两个同 schema 表格 + “对比/差异” -> `compare`。
  - 多个表格要放在一起看总量 -> `merge`。
  - 多份 Word/PDF/表格文本列要翻译 -> `batch_translate`。
  - 一个主表和一个查询表 -> `cross_ref`。
  - 多份独立文档要提炼要点 -> `summarize_all`。

向用户说明你检测到的文件、推断模式、需要的主键/维度，并请用户确认。在当前回复中用简短清单记录结构化 intent，推荐内容为严格 JSON：

```json
{
  "mode": "compare|merge|batch_translate|cross_ref|summarize_all",
  "files": [
    { "name": "A.xlsx", "type": "excel", "rows_or_pages": 1095 },
    { "name": "B.xlsx", "type": "excel", "rows_or_pages": 1203 }
  ],
  "primary_key": "工号",
  "dimensions": ["基本工资", "部门"],
  "user_goal": "对比两个月工资差异，找出调薪较多的员工"
}
```

### 2. 加载文件并做 schema 对齐

确认模式后，完整读取需要处理的文件：

- 表格类：字段名、数据类型、前 3 行样本、行数、缺失率、重复主键。
- 文档类：页数/段落数、前 200 字样本、标题结构、语言和可提取文本质量。
- 多 sheet Excel：默认不要擅自只取第一个 sheet；先列出 sheet 并询问用户或说明默认选择。
- 大文件：超过 5000 行时先抽样做 schema 分析，正式处理可用 `Bash` 分批计算。

按 mode 生成对齐表：

| mode | 对齐重点 |
|---|---|
| `compare` | 公共字段、单边字段、主键唯一性、可比较字段 |
| `merge` | 字段交集、字段差异、纵向 union 或横向 join 方向 |
| `batch_translate` | 每份文本量、源语言、目标语言、术语和格式要求 |
| `cross_ref` | 主表、查询表、join key、命中率预估、多对多风险 |
| `summarize_all` | 文档类型、时间顺序、摘要字段和跨文件分析维度 |

把 schema 对齐结果展示给用户确认；字段映射、主键或翻译方向不确定时不要继续计算。

### 3. 按模式执行

#### compare：差异对比

- 先统一主键类型、空值、日期格式和大小写/空格。
- 区分三类结果：两边都有但字段不同、A 独有、B 独有。
- 数值字段输出变化值、变化率、平均变化和异常变化 Top N。
- 分类字段输出分布变化和新增/消失类别。
- 导出差异明细表，建议 sheet 包含“字段级差异”“A 独有”“B 独有”“对比摘要”。
- 常见风险：主键重复、字段类型不一致、NaN 与空字符串混淆、日期格式不同。

#### merge：合并汇总

- 先确认是纵向 union 还是横向 join。
- 纵向 union：检查 schema 是否一致，保留来源列，说明独有字段如何处理。
- 横向 join：确认 join key、join 方式（left/right/inner/outer）和冲突字段后缀。
- 合并后输出总行数、唯一主键数、关键数值统计、分类分布、缺失率和重复项。
- 大数据量时用分批处理，必要时优先导出中间结果再生成摘要。

#### batch_translate：批量翻译

- 确认源语言、目标语言、是否保留专有名词、术语表和格式要求。
- 长文档按段落或章节分块翻译，保留顺序和标题层级。
- 表格翻译只处理用户指定文本列，跳过公式、代码、编号和不可翻译字段。
- 维护术语一致性，同一术语在所有文件中使用同一译法。
- 输出原译对照版和纯译文版；如 OCR 或源文件质量差，明确提示可靠性限制。

#### cross_ref：交叉引用 / lookup

- 明确主表 A、查询表 B，以及 join key。
- 规范化 key：字符串去空格、大小写统一、补齐前导零、日期格式统一。
- 检查一对一、一对多、多对多关系；多对多时先问用户要取最新、聚合还是保留全部。
- 统计命中、未命中、B 中孤儿记录，未命中项要导出给用户核查。
- 按用户目标追加查询字段，必要时按部门、地区、时间或职级分组统计。

#### summarize_all：批量摘要和整体总结

- 先逐文件生成结构化摘要，再做跨文件聚合。
- 报告/研报：提取主题、日期、关键数据、结论、风险、行动项。
- 合同：提取主体、金额、期限、关键条款、义务、违约和风险。
- 会议纪要：提取参会人、议题、决议、待办、负责人和截止时间。
- 简历：提取姓名、年限、岗位、技能、亮点、风险和匹配度。
- 跨文件分析可以包括趋势、共性、差异、时间序列、风险聚类或优先级排序。
- 从原文提取数字时要二次核对，避免把推断写成事实。

### 4. 生成交付物

根据结果选择交付形式：

- `Bash`：差异明细、合并主表、lookup 结果、摘要结构化表、术语表。
- `Bash`：关键指标对比、分布变化、趋势或命中率图表。
- `Write`：HTML 完整报告，开头直接给结论，正文放表格和图表，结尾给 1-3 条具体建议。
- `Skill`：仅在用户需要汇报材料时生成 PPTX；每页一个结论，bullets 控制在 4-6 条，附演讲备注。

报告模板按 mode 调整：

- compare：对比概览 -> 关键差异 -> 独有记录 -> 异常项 -> 建议。
- merge：合并策略 -> 合并统计 -> 数据质量 -> 关键分布 -> 附件说明。
- batch_translate：文件清单 -> 翻译范围 -> 术语表 -> 质量说明 -> 下载清单。
- cross_ref：lookup 概览 -> 命中/未命中 -> 补充字段 -> 核查建议。
- summarize_all：文件清单 -> 单文件摘要 -> 跨文件趋势/共性 -> 整体结论。

## 质量和安全要求

- 所有结论必须来自用户文件、实际计算或清晰标注的经验判断；禁止编造数据。
- 关键计算优先用 `Bash`，不要靠肉眼估算。
- 每次导出前说明字段口径、样本范围、缺失值处理和异常值处理。
- 文件损坏、格式不支持、编码错误或 OCR 质量差时，立即报告限制并给出替代方案。
- 每个阶段都给用户可确认的摘要；用户改主键、字段映射或处理模式时，回到对应步骤重做。


## 桌面端工具说明（迁移自旧平台）

本技能在 AIjia 桌面端运行。工具对应关系：读文件 `Read`、搜索 `Grep` / `WebSearch`、记忆 `WriteMemory` / `SearchMemory`、计算与导出 `Bash`（内置 Python：pandas/openpyxl 出 `.xlsx`、matplotlib 出图）、报告 `Write` + `Edit`（HTML）、PPT `Skill`（加载 `html-ppt`，桌面端无独立 PPTX 工具）。

**生成报告 / 长文档必须逐节增量写、用 `Edit` 续写，禁止把整份内容作为单个 `Write` 一次性吐出**——否则对话界面会长时间无响应、且易触发流式超时。

