# International Lead Research

> 自动调研国际化线索（agent、企业、平台、工具），抓取并总结信息，分析与 PaddleOCR/ERNIE 的合作可能性。当用户提到"调研线索"、"分析线索"、"搜集线索信息"、"合作可能性分析"、"线索整理"、"收集信息"、"分析agent"、"平台功能总结"、"线索信息总结"等相似词汇时触发。

- Skill: `agenticaiplan/international-lead-research` (Agent Skill)
- Install (CLI): `npx skillmds@latest add agenticaiplan/international-lead-research`
- Raw SKILL.md: https://api.skillmd.com/api/skills/agenticaiplan/international-lead-research/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: agenticaiplan (https://skillmd.com/u/agenticaiplan)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/agenticaiplan/international-lead-research

---


# International Lead Research

自动调研国际化线索（agent、企业、平台、工具），抓取并总结信息，分析与 PaddleOCR/ERNIE 的合作可能性。

## 适用场景

当用户需要对国际化线索进行调研时，使用本 Skill。线索类型包括但不限于：
- AI Agent 产品
- 海外企业或公司
- 技术平台或工具
- 其他具有潜在合作价值的国际化产品或服务

## 触发关键词

以下关键词或相似表达都会触发本 Skill：
- 调研线索
- 分析线索
- 搜集线索信息
- 合作可能性分析
- 线索整理
- 收集信息
- 分析 agent
- 平台功能总结
- 线索信息总结

## 输入要求

- **线索名称**：agent、企业、平台或工具的准确名称（例如：Perplexity）
  或
- **网站链接**：线索的官网或相关页面 URL

**输入类型处理差异**：
- **线索名称**：先通过 Google 搜索找到官网，然后继续访问 GitHub、社交媒体等其他数据源补充信息
- **网站链接**：直接访问该网站作为信息源，但仍需搜索 GitHub、社交媒体等渠道补充完整信息
  - 例如：用户输入 `https://apify.com` → 直接访问官网获取基础信息 → 继续搜索 GitHub、社交媒体补充技术细节和社区动态

## 输入处理规则

### 中文名称处理

如果用户输入的是中文名称（如"困惑"），需要先通过搜索引擎找到对应的英文官方名称，再继续后续调研流程。

**示例**：
- 用户输入："困惑" → 搜索确认对应 "Perplexity" → 继续调研
- 用户输入："开放AI" → 搜索确认对应 "OpenAI" → 继续调研

### 别名与变体处理

用户输入可能是产品别名、域名变体或拼写变体，需要自动识别并扩展搜索关键词：

| 输入类型 | 示例 | 处理方式 |
|----------|------|----------|
| 域名变体 | perplexity.ai | 自动识别为 Perplexity |
| 常见别名 | chatgpt | 识别为 ChatGPT / OpenAI |
| 拼写变体 | midjourny | 自动纠正为 Midjourney |
| 简称 | cursor | 结合上下文判断是代码编辑器还是其他产品 |

**处理原则**：
- 如果无法确定用户输入对应的具体产品，先向用户确认
- 搜索时使用扩展关键词提高匹配准确度

### 同名消歧处理

当用户输入的名称对应多个不同产品时，需要先进行消歧，向用户确认具体是哪一个。

**消歧触发条件**：
- 搜索结果显示多个同名但功能不同的产品
- 官网 GitHub 存在多个同名仓库且功能差异明显
- 社交媒体或社区讨论中存在多个同名产品

**消歧处理流程**：

1. **收集候选产品信息**：收集所有可能匹配的产品，至少包含：
   - 产品名称
   - 官网/代码库链接
   - 一句话功能描述
   - 所属领域/行业

2. **向用户提问**：以清晰格式列出候选产品，让用户选择

   **示例**：
   > 检测到 "Massive" 对应多个产品，请确认你要调研的是哪一个？
   >
   > | 选项 | 产品 | 功能描述 | 官网 |
   > |------|------|----------|------|
   > | 1 | Massive | 数据抓取/API绕过平台 | massive.dev |
   > | 2 | Massive AI | 3D游戏场景生成平台 | massive.ai |

3. **等待用户确认**：用户选择后，继续调研指定产品

4. **未确认处理**：如果用户无法确认，提供以下选项：
   - 建议用户提供更具体的信息（如领域、功能关键词）
   - 或询问是否需要分别调研所有候选产品

## 数据源优先级

按以下优先级搜索信息，**每个数据源都要尝试访问**，确保信息完整性：

1. **Google 搜索**：获取基础信息和相关链接
2. **官方网站**：了解官方介绍、功能定位、产品文档
3. **GitHub**：了解代码库、开源情况、技术实现
4. **社交媒体**：Twitter / Facebook / LinkedIn，了解用户反馈和社区动态
5. **其他来源**：技术论坛、AI 相关社区、媒体报道等

**信息完整性原则**：
- 不因从官网获取到部分信息就跳过后续数据源
- 不同数据源提供不同维度的信息，相互补充
  - 官网：官方定位、功能描述
  - GitHub：技术实现、开源程度
  - 社交媒体：用户反馈、社区动态
- 如后续数据源提供的信息与前面冲突，优先以官方网站信息为准

### GitHub 搜索逻辑

**如何确认找到的仓库是正确的**：
- 优先匹配官网首页提到的 GitHub 链接
- 根据作者信息（公司账号/创始人账号）判断
- 结合 Star 数量、更新频率等辅助判断
- 如存在多个同名仓库，选择 Star 数最多或官方认证的仓库

**组织迁移处理**：
- 部分项目会从一个组织/账号迁移到另一个（如 ComfyUI 从 comfyanonymous 迁移到 Comfy-Org）
- 通过 GitHub API 返回的重定向信息识别迁移
- 在报告中记录最新组织信息，同时可注明历史归属

**闭源产品处理**：
- 如果线索是闭源产品，在"开源程度"信息点标注"未找到代码库（闭源产品）"
- 不因找不到 GitHub 仓库而阻塞整体流程

## 执行步骤

### 第一步：信息采集

根据用户输入的线索名称或网站链接，按数据源优先级依次搜索并记录信息：
- 如果输入是线索名称，先通过 Google 搜索找到官网
- 官网无法访问时，优先从 GitHub、社交媒体等其他渠道获取信息
- 记录所有可获取的信息来源，用于资料来源标注

### 第二步：信息整理

将采集到的信息按以下板块进行整理和归纳：

| 板块 | 信息点 | 说明 |
|------|--------|------|
| 一、基础信息 | 名称 | 线索的正式名称/品牌名 |
| | 官方网站 | 官网 URL |
| | 所属国家/地区 | 总部所在地或主要运营地区 |
| | 成立时间 | 公司成立或产品发布时间 |
| | 公司背景 | 所属公司、母公司、关联企业等 |
| 二、产品定位 | 功能定位 | 核心功能、一句话描述产品 |
| | 核心功能 | 详细列出主要功能模块 |
| | 使用逻辑/场景 | 主要使用场景、典型用户流程 |
| 三、技术信息 | 技术栈/底层模型 | 使用的技术、AI 模型等 |
| | 开源程度 | 是否开源、开源协议类型 |
| 四、市场与竞品 | 用户规模/影响力 | 用户数量、下载量、关注度等 |
| | 主要竞争对手 | 同赛道的主要竞品 |
| 五、合作分析 | 可合作信息点 | 潜在合作点分析 |
| | 技术对接可能性 | 是否支持 API/SDK 集成、对接难度评估 |
| | 已有合作伙伴/生态 | 官方列出的合作伙伴或生态系统 |
| | 商业对接窗口 | 商务联系方式、BD 渠道 |
| 六、元数据 | 资料来源 | 信息采集来源列表 |
| | 更新时间 | 报告生成时间 |

## 合作分析背景

在分析线索的合作可能性之前，需了解以下百度产品背景：

**PaddleOCR**：百度开源的 OCR（光学字符识别）工具库，支持多种语言的文字识别，提供 Python/C++/JavaScript 等多种语言的 API。可应用于图像文字提取、身份证件识别、票据处理等场景。

**ERNIE**：百度的预训练语言模型系列，包括：
- **ERNIE-Bot**（文心一言）：大语言模型，提供自然语言理解与生成能力
- **ERNIE-ViLG**（文心一格）：文生图模型，提供图像生成能力
- **ERNIE-Speed**：轻量级模型，适合边缘部署

基于以上背景，分析线索与 PaddleOCR/ERNIE 的合作可能性。

### 第三步：合作可能性分析

基于以下判断依据，分析线索与 PaddleOCR/ERNIE 的合作可能性：

| 判断依据 | 分析要点 |
|----------|----------|
| 是否有 API 开放 | 官方是否提供 API、API 文档是否完善 |
| 是否支持集成 | 是否支持 SDK/插件、对接技术难度如何 |
| 目标市场是否有重叠 | 主要服务市场与百度国际化业务的重叠度 |
| 技术栈是否匹配 | 底层技术路线是否与 PaddleOCR/ERNIE 兼容 |
| 功能定位是否有重合 | 核心功能是否与 PaddleOCR/ERNIE 形成互补或竞争 |

### 第四步：自查验证

完成信息整理后，进行以下检查：
- 确认每个信息点都有来源依据，未找到信息明确标注"未找到"
- 合作分析结论基于采集到的客观信息，避免主观臆测
- 资料来源列表完整记录所有信息渠道
- 更新时间标注为当前日期

## 输出要求

### 格式要求

- 使用 **Markdown 表格** 格式输出
- 按六个板块分组展示，每个板块有清晰标题
- 信息点与内容对应清晰，一目了然

### 内容要求

- 信息准确，有据可查
- 未获取到的信息明确标注"未找到"或"信息不明确"
- 合作分析部分重点突出，便于快速判断合作价值
- 资料来源列出，方便后续追溯和验证

**多行信息处理规则**：
- 使用 `<br>` 换行符在表格单元格内展示多行内容
- 示例：多个核心功能使用 `<br>` 分隔
  ```
  • 功能一<br>• 功能二<br>• 功能三
  ```
- 复杂信息（如合作分析多个要点）建议使用 `<br>` 保持表格格式一致
- 如信息过于复杂无法在表格中清晰展示，可在表格下方添加详细说明段落

### 语言规则

**信息采集语言**：
- 优先采集英文内容（官网、文档、社交媒体等）
- 如存在中文内容，可作为补充信息源
- 多语言站点优先选择英文版页面

**输出语言**：
- 内容总结使用中文表达
- 专业术语、产品名称、技术栈等保留原文
- 示例：技术栈保留 "GPT-4"、"Claude-3.5"，不翻译为中文
- 示例：公司名称保留 "Anthropic"，标注中文别名"安思罗彼克"（如有）

**时效性标注**：
- 在"更新时间"信息点标注报告生成时间，格式：`YYYY-MM-DD`
- 信息来源有明确时间时，在相应信息点中标注：
  - **GitHub**：标注仓库创建时间、最后更新时间（例如：创建于 2023-01-17，最后更新 2024-03-15）
  - **新闻/报道**：标注发布日期（例如：[2024-02-20] TechCrunch 报道）
  - **官网/文档**：标注最后更新时间（如有显示）
- 如信息时效性存疑（如新闻时间久远），可在信息点后标注时效性提示（例如：[信息来源时间较早，可能已变更]）

### 输出模板

```markdown
## 线索调研报告：[线索名称]

### 一、基础信息

| 信息点 | 内容 |
|--------|------|
| 名称 | [内容] |
| 官方网站 | [内容] |
| 所属国家/地区 | [内容] |
| 成立时间 | [内容] |
| 公司背景 | [内容] |

### 二、产品定位

| 信息点 | 内容 |
|--------|------|
| 功能定位 | [内容] |
| 核心功能 | [内容] |
| 使用逻辑/场景 | [内容] |

### 三、技术信息

| 信息点 | 内容 |
|--------|------|
| 技术栈/底层模型 | [内容] |
| 开源程度 | [内容] |

### 四、市场与竞品

| 信息点 | 内容 |
|--------|------|
| 用户规模/影响力 | [内容] |
| 主要竞争对手 | [内容] |

### 五、合作分析 ⭐

| 信息点 | 内容 |
|--------|------|
| 可合作信息点 | [内容] |
| 技术对接可能性 | [内容] |
| 已有合作伙伴/生态 | [内容] |
| 商业对接窗口 | [内容] |

### 六、元数据

| 信息点 | 内容 |
|--------|------|
| 资料来源 | [内容] |
| 更新时间 | [内容] |
```

## 参考资料

`references/` 目录当前为空。如需补充业务上下文、内部资料或模板规范，请将资料放在 `references/` 目录，并在此处说明用途。

**可选参考资料类型**：
- PaddleOCR 技术文档和 API 说明
- ERNIE 系列产品介绍和集成指南
- 合作案例分析
- 行业报告和竞品分析模板

## 注意事项

### 信息源处理规则

- 当多个信息来源冲突时，优先以官方网站信息为准
- 官网无法访问时，继续尝试下一个数据源，不阻塞整体流程
- 对于初创团队或小规模产品，部分信息可能无法获取，标注"未找到"即可

### 失败场景处理

**单一信息源失败**：

| 错误类型 | 处理方式 |
|----------|----------|
| 官网 404 Not Found | 继续尝试 GitHub、社交媒体等其他渠道，在"官方网站"信息点标注"官网无法访问（404）" |
| 官网 500 Server Error | 继续尝试其他渠道，标注"官网暂时无法访问" |
| 官网超时/无响应 | 继续尝试其他渠道，标注"官网访问超时" |
| 地区限制/访问被拒 | 继续尝试其他渠道，标注"官网存在地区限制" |
| GitHub 搜索无结果 | 标注"未找到代码库"，继续其他信息源 |
| 社交媒体无法访问 | 尝试其他媒体渠道或技术论坛 |

**所有信息源均失败**：
- 如通过所有数据源都无法获取任何信息
- 返回明确提示："无法获取该线索的相关信息，请确认线索名称是否正确"
- 列出尝试过的所有数据源及失败原因，便于用户了解调研过程

**部分信息缺失**：
- 某些信息点无法获取时，标注"未找到"或"信息不明确"
- 不影响其他信息点的完整展示
- 在"资料来源"中说明哪些信息源尝试过但未获取到相关信息

### 内容质量要求

- 合作可能性分析应客观中立，避免过度乐观或保守
- 资料来源需完整记录，便于团队其他成员复核

