Side Event Scout
把「人工找 Side Events + 人工整理表格」自动化。输入一个大会名称,输出一份按固定 12 列格式整理、按日期排序(附 S/A/B/C 推荐等级)的 Side Event List。
核心边界(最重要的一条规则):只收大会「场外」的非官方周边活动,不收大会官方日程内的活动。 要的是阿里云晚宴、MiniMax 线下交流会这类白天逛完正式展会后、偏休闲和 connect 属性的活动;不要大会官方的 keynote、tutorial、官方 workshop、官方展区活动。
工作流
Step 0 — 理解大会
用 web search 确认大会的:正式名称与常用缩写(含中英文)、举办日期、举办城市与主会场、核心人群(researchers / founders / investors / 开发者…)。
搜索时间窗 = 大会日期前 3 天到后 1 天(周边活动常在开幕前扎堆)。
Step 1 — 多路搜索
用 WebSearch(或环境里其他可用的 web search 工具)跑多组查询,每组都要跑,不要只跑一两条就停。国际大会以 Luma 为主力源,中国大会(WAIC 等)以微信/媒体盘点为主力源:
- 优先找 Luma Events Calendar 聚合页(单页聚合几十个周边活动,产出最高):搜
site:luma.com <缩写> calendar、直接试luma.com/<缩写>和luma.com/<缩写><年份>,以及 "Road to <大会> (Unofficial Community Events)" 这类社区日历;找到后抓取日历页上的全部活动链接。⚠️ Luma 官方日历页(如luma.com/icml)是 JS 渲染的,WebFetch 只能拿到空壳——遇到这种情况必须用 Chrome 浏览器工具(claude-in-chrome)打开真实页面滚动抓全列表;社区日历一般可直接 WebFetch,但覆盖不全,不能只依赖一个日历 - 盘点/总览文章(中文活动最高产源):搜
<大会名> 场外活动/线下活动/晚宴 盘点/总览/汇总,除雷峰网、机器之心、量子位、新智元等行业媒体外,大量微信公众号也会发整理帖(社区号、个人号、聚合号),一篇盘点常覆盖十几个只在微信发布的活动。顺手也搜<大会> 线下活动 总览 飞书/表格/汇总——有人分享的现成整理表偶尔能搜到,一张顶几十条查询,搜不到不强求。⚠️ 微信公众号原文搜索引擎搜不到,但转载镜像能搜到:拿活动名/标题关键词再搜一轮,163.com、百家号、搜狐号、知乎常有公众号文章的镜像转载 site:luma.com "<大会名>"和site:luma.com <缩写> <年份>(luma.com 与 lu.ma 都算),多轮换词:afterparty / happy hour / dinner / mixer / reception / social / night / lunch——单靠一两条 query 会漏掉大量不在日历上的独立 Luma 活动<大会名> side event / mixer / dinner / party / happy hour / reception / meetup- 定向搜高频主办方(按大会类型选名单,逐个搜
<机构名> <大会缩写> 晚宴/交流会/之夜/party,多数只在微信发布):- 学术顶会(ICML/NeurIPS 等):大厂(字节、腾讯、阿里、华为、小米、快手、蚂蚁、MiniMax)和量化基金(九坤、幻方、明汯、衍复、Ubiquant、佳期)——招聘/学术晚宴常客
- 产业大会(WAIC 等):VC 和加速器才是场外主力——蓝驰、线性、源码、红杉、九合、锦秋、光源、星连、明势、绿洲、奇绩/MiraclePlus,加速器/空间类:火山引擎 V-START、蚂上、模速空间、AGI Bar。注意联办规律:一家加速器常联合主办多场(如某届 WAIC 火山引擎 V-START 一家联办 5 场),搜到一场就顺着联合主办方名单继续挖
<大会名> 晚宴 / 交流会 / 酒会 / 线下活动(中文大会或中国公司主办的活动常只在微信公众号/小红书发布)- Side Event 聚合站(中国大会的"Luma 日历"等价物):WaytoAGI Side Events(如
waic.waytoagi.com,按大会找对应子站)、aieventmap.com、活动行huodongxing.com。⚠️ 大会结束后聚合站常把历史列表下线——用 Wayback Machine 回溯:curl -sL "https://web.archive.org/web/<大会期间时间戳>000000/<聚合站URL>"(WebFetch 不支持 web.archive.org,必须用 curl;429 限流就间隔重试),从快照 HTML 里提取活动详情页链接再逐个抓存档 - Luma 城市发现页:
https://luma.com/discover下对应城市页,扫时间窗内的活动 - 补充源(能搜到就收,Source 如实标注):Eventbrite、Partiful、微信公众号文章、小红书(大量活动只发小红书帖,站内帖搜索引擎索引差,多靠转述/群传播,搜到线索就顺藤摸瓜)、Twitter/X、知乎(RTE 开发者社区等常发盘点帖)
对每个候选活动,用 WebFetch(或其他可用的网页抓取工具)打开活动页,提取完整信息。搜索结果摘要不足以填表,必须打开活动页原文(活动已过期页面通常仍可访问)。候选活动多(>20 个)时,分批交给并行子 agent 抓取,每个 agent 返回结构化 JSON。
停止条件:连续 2 轮新查询没有发现新活动,才算搜完。最后在报告里如实说明搜了哪些源、哪些没搜。
Step 2 — 筛选
收录(场外周边,供参会人群 connect / 休闲):
- Private Dinner / 晚宴、Mixer / Party / Reception / Happy Hour
- Coffee Chat / Café takeover / Coworking space
- 闭门交流、Salon、Demo Night、社群 Meetup、招聘晚宴(大厂 talent night 也算,人群匹配即可)
排除:
- 大会官方日程内的活动(官方 workshop / tutorial / keynote / 官方 expo booth 活动)
- 与大会无关的同城活动:活动页没提大会、也看不出面向大会人群的,不收
- 纯线上活动、纯广告 webinar
判断标准:活动页明确提到大会(@ICML、before WAIC 等),或时间地点+人群明显是冲着大会参会者来的。拿不准的收进去、推荐等级给 C 并在备注说明,不要静默丢弃。
Step 3 — 提取字段 + 去重
每个活动按 references/format.md 的固定列填写。信息缺失的字段填 /,不要编造。活动页本身缺日期/时间时,可用日历聚合页或盘点文章里标注的日期回填(这也是可信来源)。
去重规则:
- 主键:标题归一化(去 emoji / 标点 / 大小写)+ 日期;同名同日 = 同一活动
- 同主办方 + 同日 + 同时段 + 同地点,即使标题不同也疑似重复(同一活动多平台发布),合并成一条
- 合并时保留信息最全的一条,报名链接可多个并列,Source 并列标注
- 注意反例:同一主办方的系列活动(如同一公司连办三晚 dinner、同一日历下的多场 café 活动)不是重复,按不同日期/场次分行列出
- ⚠️ 不要用来源 URL 当去重主键:一篇媒体盘点文章会覆盖多个活动(同 URL ≠ 同活动);只有活动平台链接(Luma/Partiful/Eventbrite)的同 slug 才能判定同一活动
Step 4 — 推荐等级 S / A / B / C
综合四个维度打分,推荐原因一句话点明关键维度:
| 维度 | 看什么 |
|---|---|
| 主办方质量 | 一线 lab / 知名基金 / 明星公司 / 有影响力社群 > 无名主办方 |
| 人群匹配 | 面向 founders / researchers / investors 等目标人群的精准活动 > 泛人群 |
| 规模与深度 | 小规模 / 邀请制 / curated 名单(深度 networking)> 大规模开放(易参加但泛) |
| 信息可信度 | 信息完整、报名通道明确 > 信息残缺、真假难辨 |
- S:主办方一线 + 人群高度匹配 + 小规模/邀请制,networking 价值极高
- A:主办方质量好、人群匹配,规模中等或开放报名
- B:大规模开放活动,容易参加但人群较泛,深度 networking 价值一般
- C:相关性弱 / 信息不全 / 纯宣传性质,但仍可能有价值,留给读者自判
Step 5 — 输出
- 本地 markdown(先产出,便于 review):按日期升序排序(推荐等级只是一列信息,不改变排序),另附一段「搜索覆盖说明」(搜了哪些源、时间窗、收录/排除了多少)。
- 问用户要哪种交付形式(用大白话问,不要甩术语)。先自查环境里有没有可用的飞书写表工具(
lark-cli/lark-sheetsskill),然后给用户两个选项:- A. 直接生成飞书表格:需要电脑上装好 lark-cli 并授权过飞书账号。如果检测到没装/没授权,如实告诉用户"需要先安装并授权飞书命令行工具,我可以带你一步步弄",用户不想弄就走 B。
- B. 生成 CSV 文件:不需要任何飞书工具,直接给一个表格文件,用户可以自己上传到飞书(飞书里"新建 → 导入"即可)或用 Excel 打开。
- 飞书表格(用户选 A):按 references/format.md 的布局写入新表格,按日期升序。写表必须走
lark-sheetsskill(先读它的 SKILL.md 及其要求的前置文档):新建表用+workbook-create --values -(stdin 传 JSON 二维数组,全文本列,含标题行/表头/数据行);修正已建的表用+csv-put --start-cell A1整体覆写。 CSV 文件(用户选 B):按同样的列输出 UTF-8 带 BOM 的 CSV(Excel 打开不乱码),告诉用户文件在哪、怎么导入飞书。 - 最后把交付物(飞书表格链接或 CSV 文件路径)和分级统计(S×n / A×n / B×n / C×n)汇报给用户,S/A 级活动在汇报里单独点名。
注意
- 抓取时机决定查全率:Side Event 信息半衰期极短——大会结束后 Luma 下沉过期活动、聚合站下线列表、微信传播链冷却。大会前 1-2 周到会中是黄金窗口;赛后回溯查全率必然大幅下降(需重度依赖 Wayback 多时间戳快照),必须在报告里向用户说明这一点
- 中国大会(WAIC 等)的周边活动大量只在微信公众号 / 小红书发布,Luma 覆盖不到,报告里必须提醒这一局限
- 活动信息随时会变(改期、改场地、报名截止),表格里记录的是抓取时点的信息;抓取日期写进表格的说明行
- 不要把同一大会往年的活动混进来,日期必须落在本届时间窗内