Amazon AI 工具评估
目标
从真实业务问题和人工基线出发,用同一测试集验证准确性、节省时间、数据风险和可回退性,避免因热点或演示效果盲目换工具。
何时使用
- 团队不断追逐新 AI 工具但没有稳定产出
- 准备购买订阅、上传业务数据或连接店铺权限
- 需要比较人工、现有工具和新工具的总成本
开始前要拿到
- 明确业务任务、当前人工流程、耗时、质量和失败成本
- 候选工具能力、价格、权限、数据保留/训练/删除政策
- 同一脱敏测试集、正确答案、评分标准和异常样本
- 集成成本、负责人、审计日志、退出与数据迁移方案
缺失项必须标为 UNKNOWN 或 NEEDS_EVIDENCE;不得猜数字、补属性,或混用不同站点、主体、ASIN、币种和时间窗。
不可妥协的边界
- 当前法律、Amazon 官方规则、目标账户实时状态和一方业务报告优先;公开内容与第三方数据只能作为待验证启发或代理证据。
- 默认提供诊断或草案。写入前展示对象、旧值、新值、影响、停止线与回退,核对用户已有授权是否覆盖对象、动作与预算;范围已明确授权时继续执行并回读核验,只有未覆盖或扩大的范围才请求批准。
- 数值、政策、因果和执行状态分别标为
FACT、ESTIMATE、ASSUMPTION或UNKNOWN。 - 不保存或输出素材来源身份、账号、链接、文章编号、发布日期、阅读量、原始话术或其他可反查线索。
- AI 输出是候选,不是证据;涉及合规、税务、声明或账户风险时由合格人员复核。
- 未经数据处理、保留和训练条款确认,不上传客户、店铺、财务或未公开产品数据。
- 工具自述、演示案例和生成内容不能作为准确性证明。
- 任何拥有账户写权限的工具都需最小权限、审批、日志和可撤销连接。
工作流
- 先定义要减少的业务损失或等待时间,不从工具功能列表反推需求。
- 记录人工/现有流程基线,建立包含正常、边界和对抗样本的脱敏测试集。
- 让候选方案处理同一测试集,评分准确、引用、稳定、漏错和人工返工。
- 核对价格、配额、延迟、集成、权限、数据保留、训练用途和删除能力。
- 仅对可回退低风险任务做限时试点,预设失败、超支和安全停止线。
- 用总成本、净节省和风险选择采用、有限采用、观望或淘汰,并保留退出方案。
判断状态
READY:关键输入、当前规则、证据和专业复核均已满足,方案可回退。HOLD:方向可能成立,但关键事实、资格、样本或审批仍缺失。STOP:存在违法违规、证据虚假、敏感数据风险、不可承受经济性或无法回退。
必须交付的结果
- 问题与人工基线
- 同一测试集评估结果
- 成本、权限、隐私和集成矩阵
- 采用决策、试点和退出计划
- 数据范围、采集时间、定义、证据状态、限制和待批准动作
详细台账与质量门见 references/playbook.md。