# Datasets Search

> 搜索和爬取网络上数据集相关信息，包括开源数据集、企业数据集发布、高质量数据集参评等。提取数据集名称、内容介绍、所属企业名称（简称自动扩展为全称），标记高质量数据集，生成结构化报告。用于：1) 搜索最新的数据集资源，2) 追踪企业数据集动态，3) 发现开源数据集链接，4) 每周生成数据集增量报告。

- Skill: `agenticaiplan/datasets-search` (Agent Skill, multi-file: 9 files)
- Install (CLI): `npx skillmds@latest add agenticaiplan/datasets-search`
- Raw SKILL.md: https://api.skillmd.com/api/skills/agenticaiplan/datasets-search/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: agenticaiplan (https://skillmd.com/u/agenticaiplan)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/agenticaiplan/datasets-search

---


# 数据集搜索 (datasets-search)

爬取网络上关于数据集发布、开源、认证的新闻，自动提取关键信息并生成结构化报告。

## 核心功能

1. **多源新闻爬取** - 从技术媒体、企业博客、开源社区等渠道获取数据集相关新闻
2. **智能信息提取** - 自动识别数据集名称、企业名称、数据集描述
3. **企业名称扩展** - 将企业简称（如"百度"、"阿里"）自动扩展为全称（如"北京百度网讯科技有限公司"、"阿里巴巴集团控股有限公司"）
4. **质量标记** - 识别并标记被认证为"高质量数据集"的内容
5. **增量报告** - 对比历史数据，输出本周新增的数据集信息
6. **链接提取** - 抓取数据集开源链接、官方描述页面

## 工作流程

```
用户请求爬取数据集新闻
    │
    ▼
运行爬虫脚本 → 抓取多个数据源
    │
    ▼
解析提取信息 → 数据集名称/企业/描述/链接
    │
    ▼
企业名称扩展 → 简称→全称映射
    │
    ▼
质量标记识别 → 标记高质量数据集
    │
    ▼
生成增量报告 → 对比历史输出新增内容
    │
    ▼
返回结构化列表 → Markdown格式报告
```

## 使用方法

### 1. 爬取最新数据集新闻

```bash
python3 scripts/dataset_crawler.py --days 7 --output report.md
```

### 2. 查看增量报告（对比历史）

```bash
python3 scripts/dataset_crawler.py --incremental --state-file ~/.dataset_crawler_state.json
```

### 3. 指定数据源

```bash
python3 scripts/dataset_crawler.py --sources jiqizhixin,infoq,oschina
```

## 输出格式

生成的报告为Markdown格式，包含以下字段：

```markdown
## 数据集新闻报告 (2024-01-15)

### 本周新增数据集 (5条)

| 数据集名称 | 企业名称 | 数据集描述 | 高质量标记 | 相关链接 |
|-----------|---------|-----------|-----------|---------|
| 百度文心大模型数据集 | 北京百度网讯科技有限公司 | 用于训练文心大模型的中文数据集，包含... | ⭐ | [链接](https://...) |
| AliQA开源问答数据集 | 阿里巴巴集团控股有限公司 | 面向电商领域的问答数据集，包含100万... | - | [GitHub](https://...) |
```

## 数据源配置

爬虫默认支持以下数据源，可在`references/data_sources.md`中查看详情和添加新源：

### 稳定数据源 ✅

| 数据源 | 类型 | 可用性 | 说明 |
|--------|------|--------|------|
| **GitHub** | 开源平台 | ⭐⭐⭐⭐⭐ | API 稳定，成功率高 |
| **Gitee** | 国内开源 | ⭐⭐⭐⭐ | API 可用，部分已知数据集 |
| **ModelScope** | 阿里云平台 | ⭐⭐⭐⭐ | API 可用，高质量数据集 |
| **智源研究院** | AI研究院 | ⭐⭐⭐⭐ | 已知数据集列表 |
| **数据堂/标贝/拓尔思/海天瑞声** | 数据服务商 | ⭐⭐⭐⭐ | 已知数据集列表 |

### 不稳定数据源 ⚠️

| 数据源 | 类型 | 可用性 | 说明 |
|--------|------|--------|------|
| **机器之心** | AI媒体 | ⭐⭐ | 有反爬措施，可能失败 |
| **InfoQ** | 技术平台 | ⭐⭐ | 有反爬措施，可能失败 |
| **开源中国** | 开源社区 | ⭐⭐ | 有反爬措施，可能失败 |
| **站长之家** | 技术媒体 | ⭐⭐ | 有反爬措施，可能失败 |

> ⚠️ **重要提示**: 机器之心、InfoQ、开源中国等站点均有反爬措施，User-Agent 轮换和随机延迟不足以保证稳定可用。建议：
> - 多次运行脚本以获取更多数据
> - 或使用 **web-access skill** 作为降级方案检索这些站点

## 企业名称映射

企业简称到全称的映射表存储在`references/company_mappings.md`中。如需扩展映射关系，请编辑该文件。

常见映射示例：
- 百度 → 北京百度网讯科技有限公司
- 阿里/阿里巴巴 → 阿里巴巴集团控股有限公司
- 腾讯 → 深圳市腾讯计算机系统有限公司
- 字节/字节跳动 → 北京字节跳动科技有限公司

## 技术说明

### 依赖安装

```bash
pip install requests beautifulsoup4 lxml feedparser
```

### 反爬虫策略

- 内置请求间隔（默认2-5秒随机延迟）
- 使用User-Agent轮换
- 支持代理配置（通过环境变量`HTTP_PROXY`/`HTTPS_PROXY`）

### 数据去重

通过数据集名称+企业名称的组合进行去重，状态文件保存在`~/.dataset_crawler_state.json`

## 定时任务配置

建议每周日执行一次，获取本周增量信息：

```bash
# 添加到crontab (Mac/Linux)
0 9 * * 0 cd /path/to/skill && python3 scripts/dataset_crawler.py --incremental --output weekly_report.md
```

## 注意事项

1. **爬取成功率不保证**: 部分数据源（机器之心、InfoQ、开源中国等）有反爬措施，可能无法获取数据
2. **降级方案**: 如需检索不稳定数据源，建议使用 **web-access skill** 进行更可靠的网页访问
3. **推荐数据源**: GitHub、Gitee、ModelScope、智源研究院等数据源稳定性较高
4. 爬取频率请遵守各网站的robots.txt规则
5. 建议使用增量模式避免重复处理历史数据
6. 如遇网站结构变更，可能需要更新爬虫解析规则

## 降级方案

当内置爬虫无法获取某些数据源时，推荐以下替代方案：

### 1. 使用 web-access skill

```bash
# 使用 web-access skill 检索特定网站
/web-access https://www.jiqizhixin.com/search?query=数据集
```

### 2. 手动配置代理

```bash
# 设置代理环境变量
export HTTP_PROXY=http://your-proxy:port
export HTTPS_PROXY=http://your-proxy:port
python3 scripts/dataset_crawler.py --days 7
```

### 3. 使用已知数据集列表

脚本内置了部分已知的高质量数据集列表（来自智源研究院、数据堂、标贝科技等），即使网络爬取失败，仍可返回这些基础数据。

