# Expert Collection Analysis

> 智库专家AI数据采集与分析 - 自动化采集政府、智库、媒体的权威专家言论，进行AI智能分析和优先级评分

- Skill: `agenticaiplan/expert-collection-analysis` (Agent Skill, multi-file: 8 files)
- Install (CLI): `npx skillmds@latest add agenticaiplan/expert-collection-analysis`
- Raw SKILL.md: https://api.skillmd.com/api/skills/agenticaiplan/expert-collection-analysis/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: agenticaiplan (https://skillmd.com/u/agenticaiplan)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/agenticaiplan/expert-collection-analysis

---


# 智库专家数据采集与分析 Skill

## 适用场景

本Skill适用于以下业务场景：

### 主要场景
- **智库研究机构**：建立AI数据领域专家知识库，跟踪权威专家最新观点
- **企业战略部门**：监控行业专家动态，识别高价值合作对象
- **政府部门**：构建专家资源库，支持政策制定和咨询
- **学术会议组织**：筛选高价值专家，进行精准邀请

### 任务特点
- 需要从多个权威信息源采集专家言论（政府、智库、媒体）
- 需要AI智能分析专家与特定领域（如AI数据）的相关度
- 需要对专家进行优先级排序，识别高价值专家
- 需要专业的数据导出格式（Excel双工作表）
- 需要与飞书多维表格等办公系统集成

## 输入要求

使用本Skill需要准备以下输入：

### 必需输入
1. **采集领域关键词**
   - 默认：人工智能、数据要素、算力、大模型、数字经济
   - 可自定义搜索关键词列表

2. **时间范围**
   - 默认：最近24个月
   - 可调整时间窗口

3. **飞书配置**（如需飞书集成）
   - app_id：飞书应用ID
   - app_secret：飞书应用密钥
   - app_token：多维表格app_token
   - table_id：目标数据表ID

### 可选输入
- 优先级评分权重调整（默认：相关度60% + 权威性40%）
- 单个信息源采集数量限制（默认：20条/源）
- 自定义信息源配置

## 执行步骤

### 步骤1：确认采集目标和范围
- 确认要采集的领域关键词
- 确认时间范围（默认24个月）
- 确认信息源配置（15个权威源）

### 步骤2：自动化数据采集
系统将从以下15个权威信息源采集数据：

**政府部门（5个）**：
- 国务院常务会议相关信息
- 国家数据局政策动态
- 工业和信息化部行业报告
- 科技部发展战略
- 中央政府AI政策

**权威智库（5个）**：
- 国务院发展研究中心研究报告
- 中国信息通信研究院分析报告
- 中国社会科学院学术成果
- 国家高端智库专题研究
- 清华大学AI研究进展

**权威媒体（5个）**：
- 人民网专家观点
- 新华网政策解读
- 央广网产业分析
- 经济日报经济趋势
- 财经网行业动态

每个信息源生成2个搜索URL（网页搜索 + 新闻搜索），共30个真实百度搜索链接。

### 步骤3：数据清洗与过滤
- 时间过滤：保留时间范围内的数据
- 智能去重：按专家姓名+言论内容去重
- 数据验证：确保必填字段完整

### 步骤4：AI智能分析
对每条专家言论进行AI分析：

1. **相关度评分**（0-100分）
   - 分析发言内容与目标领域的相关性
   - 提取关键主题和观点

2. **权威性评分**（0-100分）
   - 评估专家身份、机构地位
   - 分析影响力和学术声誉

3. **综合优先级计算**
   ```
   综合分数 = 相关度 × 0.6 + 权威性 × 0.4

   高优先级 ⭐⭐⭐：综合分≥70 且 相关度≥60
   中优先级 ⭐⭐：综合分≥50 或 相关度≥40
   低优先级 ⭐：其他
   ```

### 步骤5：专家信息聚合
- 按专家姓名聚合所有言论
- 补充专家档案信息（单位、职务、简介）
- 统计发言次数和主题分布
- 推荐适合的交流活动

### 步骤6：生成专业报告
- 生成Excel双工作表文件
- 工作表1：专家档案（专家基本信息、优先级、相关度）
- 工作表2：专家言论（链接、时间、内容、主题、要点）
- UTF-8 BOM编码，完美支持中文
- 可直接导入飞书多维表格

## 输出要求

### 主要输出

#### 1. Excel专业报告
**文件路径**：`output/专家分析报告_YYYYMMDD_HHMMSS.xlsx`

**工作表1：专家档案**

| 列名 | 类型 | 说明 |
|------|------|------|
| 专家姓名 | 文本 | 专家完整姓名 |
| 最新单位 | 文本 | 当前工作机构 |
| 最新职务 | 文本 | 当前职务 |
| 简介 | 文本 | 专家背景介绍（≤500字） |
| 发言统计 | 数字 | 采集到的言论总数 |
| 优先级 | 文本 | 高/中/低 |
| AI数据相关度 | 数字 | 0-100分 |

**工作表2：专家言论**

| 列名 | 类型 | 说明 |
|------|------|------|
| 链接 | 超链接 | 百度搜索URL |
| 时间 | 日期 | 发布日期 |
| 专家姓名 | 文本 | 发言人姓名 |
| 正文 | 文本 | 言论完整内容 |
| 发言主题 | 文本 | 核心话题 |
| 发言要点 | 文本 | 关键观点摘要 |
| 活动背景 | 文本 | 发言场合/事件背景 |

#### 2. JSON结构化数据
**文件路径**：`output/expert_analysis_YYYYMMDD_HHMMSS.json`

包含完整的结构化数据，便于程序化处理：
```json
{
  "timestamp": "2026-04-15T09:03:00",
  "experts": [...],
  "speeches": [...],
  "statistics": {
    "total_experts": 8,
    "high_priority": 0,
    "medium_priority": 7,
    "low_priority": 1
  }
}
```

#### 3. 高优先级专家清单
**文件路径**：`output/high_priority_experts_YYYYMMDD_HHMMSS.json`

单独提取高优先级专家，便于快速建联。

### 输出质量要求

✅ **数据完整性**
- 所有必填字段不为空
- 时间格式标准化（YYYY-MM-DD）
- 链接真实可访问


## 📦 提供的脚本

本Skill在 `scripts/` 目录下提供了以下可执行脚本：

### 1. daily_update.py
**主执行脚本**，用于自动化数据采集和分析：

```bash
python scripts/daily_update.py
```

**功能**：
- 从15个权威信息源采集数据
- AI智能分析评分
- 生成Excel报告
- 支持飞书表格集成

**依赖**：需要配合以下模块使用（用户需自行实现或参考references/）
- enhanced_main.py - 主处理引擎
- enhanced_crawler.py - 数据采集器
- ai_analyzer.py - AI分析模块
- config.ini - 配置文件

### 2. analyze_experts.py
**专家分析工具**，用于对已采集的数据进行深度分析：

```bash
python scripts/analyze_experts.py
```

**功能**：
- 读取采集的JSON数据
- 计算专家优先级
- 生成分析报告

### 3. run_collection.sh
**一键执行脚本**（Bash），快速启动完整流程：

```bash
bash scripts/run_collection.sh
```

**流程**：
1. 检查环境和依赖
2. 执行数据采集 (daily_update.py)
3. 生成分析报告
4. 显示结果路径

## 🛠️ 实现说明

本Skill采用**模块化设计**，提供两种使用方式：

### 方式1：使用提供的脚本（推荐）

**优点**：开箱即用，功能完整
**要求**：Python 3.8+，需要实现依赖模块

```bash
# 1. 安装依赖
pip install requests beautifulsoup4 lxml openpyxl

# 2. 实现或复用依赖模块（参考references/README.md）
# - enhanced_main.py
# - enhanced_crawler.py
# - ai_analyzer.py
# - config.ini

# 3. 执行采集
python scripts/daily_update.py
```

### 方式2：通过Agent动态实现

**优点**：无需Python环境，灵活可定制  
**要求**：使用Claude Agent + baidu-search skill

**步骤**：
1. **数据采集**：使用 `baidu-search` skill搜索15个权威信息源
2. **智能分析**：通过Claude API进行AI优先级评分
3. **结果导出**：使用Python/Node.js生成Excel文件

**参考代码**：
```python
# 1. 搜索数据
from baidu_search import search
results = search("国务院 人工智能 2026")

# 2. AI分析
analysis = {
    "expert_name": "提取的专家姓名",
    "relevance_score": 85,  # 相关度评分
    "priority": "高"
}

# 3. 导出Excel
import openpyxl
wb = openpyxl.Workbook()
ws = wb.active
ws.append(["专家姓名", "优先级", "相关度"])
ws.append([analysis["expert_name"], analysis["priority"], analysis["relevance_score"]])
wb.save("专家分析报告.xlsx")
```

详细实现说明请参考 [references/README.md](references/README.md)

✅ **分析准确性**
- 优先级判断逻辑清晰
- 相关度评分有依据
- 专家信息真实可靠

✅ **格式规范性**
- Excel编码：UTF-8 with BOM
- 中文显示无乱码
- 可直接导入飞书表格

### 风险与假设

**⚠️ 风险提示**
1. **搜索结果时效性**：百度搜索结果依赖网络实时状态
2. **专家信息准确性**：需人工核实关键专家的单位职务
3. **权限要求**：飞书API需要企业管理员审批权限
4. **采集频率**：建议每日更新不超过1次，避免频繁请求

**📋 假设条件**
1. 网络环境可访问百度搜索
2. Python 3.8+ 环境已安装
3. 必要依赖包已安装：requests、beautifulsoup4、lxml、openpyxl
4. （可选）飞书权限已配置

**✓ 需确认事项**
- [ ] 采集的领域关键词是否准确
- [ ] 时间范围是否符合需求
- [ ] 优先级评分权重是否合理
- [ ] 是否需要飞书集成

## 参考资料

详细的使用说明、配置示例和技术文档请参考 `references/` 目录：

- `百度搜索集成指南.md` - 如何配置和使用百度搜索采集
- `快速参考.md` - 快速上手指南
- `项目完成总结.md` - 系统架构和实现细节
- `数据来源真实性解决方案.md` - 数据源配置说明

## 快速使用

### 安装依赖
```bash
pip install requests beautifulsoup4 lxml openpyxl
```

### 执行采集
```bash
python daily_update.py
```

### 查看结果
```bash
# 打开生成的Excel报告
open output/专家分析报告_*.xlsx

# 或查看JSON数据
cat output/expert_analysis_*.json
```

### 定时更新
系统支持每天早上9:03自动执行（需Claude会话保持运行）。

---

**版本**：v1.0.0
**License**：MIT

