aggregation_counting
目标
解决“需要把若干分散记录的数量累加为一个最终总数”的搜索问题。
这类问题往往没有单一网页直接给出“总数”,而要靠人工把多条来源中的子数量相加,因此需要专门的分解-聚合策略。
适用场景
- 统计某事件在不同地点造成的总死亡人数(如 Fujimori 案中的 Barrios Altos + La Cantuta)。
- 统计某时间段内某单位下属所有支部参与活动的总数(如新疆大学计算机学院支部数)。
- 求数学方程所有正解的个数(如 sin πx = |log x| 的 x>0 解数)。
- 统计某高校所有学院/系成立周年的总和(如华侨大学计算机学院周年)。
- 统计某政策覆盖的全部城市数量。
不适用场景
- 单一网页已直接给出总数(如“Swinburne University 位于 Melbourne”)。
- 问题只要求确认是否存在,而非具体数量。
- 需要实时动态数据(如当前在线人数),无法通过静态累加获得。
核心原则
- 先拆分再聚合:把“总数”拆成若干可独立验证的子项,再分别搜索并累加。
- 统一口径:确保所有子项使用同一计量单位(人、次、个、年等),必要时换算。
- 交叉验证:每个子项至少用两条独立来源确认,避免重复计数或遗漏。
- 记录溯源:在累加过程中保留每个子项的来源链接或片段,方便回溯。
标准执行流程
- 识别总数维度
明确“总数”到底指什么(人数、次数、年数、解数等)。 - 列出潜在子项
根据常识或初步搜索,把总数拆成可能存在的子项列表(地点、时间、类别)。 - 构造子查询
为每个子项构造精准查询:"{子项名} {维度} 数量"或"{事件名} {地点} 死亡人数"。 - 逐一验证并去重
对每个子项结果进行交叉验证,剔除重复、估算或不可靠数据。 - 统一单位并累加
把所有确认无误的子项数值相加,得到初步总数。 - 二次核查
用更宽泛的查询(如“{事件} 总死亡人数”)搜索是否有官方一次性给出的总数,与累加结果比对。 - 输出带源总数
用\boxed{总数}格式呈现,并附注每个子项的来源片段或链接。
检索策略模板
- 子项精准查询:
"{子项关键词} {维度} site:gov.cn" - 官方汇总查询:
"{事件/机构} 总数/总量 site:official_site.edu.cn"
补充策略 (from dataset mining: aggregation_counting)
核心原则
- 先找权威全集:优先锁定官方/权威来源的“完整名单”或“目录”,避免逐条搜索导致遗漏。
- 逐项验证:对名单中的每一项二次检索确认其符合问题限定条件(时间、地域、级别等)。
- 去重计数:合并结果时按唯一标识(ID、名称+年份)去重,再统计数量或生成最终列表。
标准执行流程
- 解析聚合维度
明确需要统计的维度(项目数、金额、成员列表等)及限定条件(时间、地域、级别)。 - 搜索“全集”来源
用{entity} 全部 {item} 列表 site:gov.cn或{entity} complete list of {item}等模板找官方目录。 - 提取候选列表
从步骤 2 的结果中复制/整理出候选条目,保存为临时清单。 - 逐项验证条件
对清单中的每一项,用{item} {限定条件}再次搜索确认其有效性;剔除不符合条件的条目。 - 去重与格式化
按唯一键去重,统一格式(如统一货币、单位),准备汇总。 - 计算聚合值
计数、求和或生成最终列表;若需多维度,分别计算后合并。 - 交叉验证
用第二个独立来源抽查 10% 的样本,确保准确率;若差异>5%,回到步骤 4。 - 输出带来源的答案
给出最终数字/列表,并附“数据来源+检索时间”以便复核。
检索策略模板
- 全集检索:
"{entity}" "list of {item}" site:gov.cn OR site:edu.cn - 单条验证:
"{item_name}" "{限定条件}" -site:spam.com