wohu-amazon-skill-creator
本 skill 用于把亚马逊卖家或自媒体的重复工作流沉淀为可复用 Codex skill,并优先支持 Sorftime、SIF、SellerSprite 当前可用 MCP 工具。目标不是替用户做一次分析,而是把“以后每次都这样做”的流程写成可触发、可执行、可验证的 skill。
先判断任务类型
每次触发后先判断用户处在哪种入口:
- 新建 skill:用户想把一个业务流程、运营 SOP、选品/广告/Listing/监控动作变成 skill。进入“5 步通关条件”。
- 优化已有 skill:用户给出 skill 路径、已有文件或要求“优化/升级/重构这个 skill”。先读取现有
SKILL.md和相关 references,输出缺点诊断,再提出修改计划;不要从 5 步流程重新问起。 - 审查已有 skill:用户只要 review、找缺点、分析触发问题。按代码审查方式输出问题、风险、建议;不直接修改,除非用户明确要求实施。
如果用户的需求只是一次性写代码、读取 CSV、总结文件、做单次市场分析,不要使用本 skill,除非用户明确说要把流程做成可复用 skill。
沟通规则
- 全程使用简体中文。
- 先用业务语言,必要时再解释技术词。第一次出现“断言”“benchmark”“frontmatter”等词时,用一句话解释。
- 不把整份模板扔给用户填写;用选项 + 短问答逐步收集信息。
- 不虚构 MCP 能力。只引用当前 Codex 环境可发现的 Sorftime、SIF、SellerSprite 工具;不确定时说“需先确认工具是否可用”。
- 不在用户未确认前执行真实店铺高风险写操作,例如改价、调预算、创建广告、下发补货单。
- 读取已有 skill、用户文件或业务资料时,只读取完成任务必需的文件;不要求无关店铺账号、token 或客户数据,报告中不得暴露密钥、token 或客户敏感信息。
- Amazon 数据源降级必须按数据对象分层:亚马逊公开前台、竞品公开数据、SellerSprite/SIF/Sorftime 等第三方市场数据,可在工具不可用时用公开前台或浏览器降级,并标注来源、抓取时间、口径差异和限制;自己店铺后台、广告、订单、库存、财务、结算等私有经营数据只能来自官方 API、MCP、团队可信服务或官方导出文件,后台数据源失败时标注阻塞或 partial,不得用浏览器、视觉检查、截图或网页抓取兜底替代。
- 字符数、触发词重叠、评测通过率、benchmark 汇总、JSON 格式校验等确定性计算必须脚本化,优先使用
scripts/中的脚本,不要交给 LLM 手算。 - 创建、优化、审查或评测前先标注数据质量等级 A/B/C/D;输入质量不足时只输出草案、限制或补问,不把片段信息包装成完整结论。
- 每条诊断、优化建议或创建决策都绑定证据等级:强 / 中 / 弱 / 冲突 / 无证据。弱证据和冲突证据只能触发补验证、降级建议或请求确认,不能直接支撑高风险修改。
- 涉及子 agent、forward-test 或委派时,默认不启用;只有用户明确确认、当前会话可用且任务边界清楚时,才允许建议调用
spawn_agent。若已有启用意图,也要评估是否应取消启动。
创建前质量门
新建 skill 不是默认动作。进入写文件或生成完整草稿前,先按下面 7 项判断输入材料是否足够:
| 检查项 | 判断问题 |
|---|---|
| 任务稳定性 | 这个流程是否会重复使用,而不是一次性问答 |
| 输入完整性 | 用户以后会提供什么参数、文件、路径或数据 |
| 输出明确性 | 最终交付物、保存位置和完成信号是否清楚 |
| 边界清晰度 | 哪些场景不该由这个 skill 处理 |
| 工具可用性 | 所需脚本、MCP、API 或文件是否存在,缺失时如何降级 |
| 安全可控性 | 是否涉及外部写操作、账号、权限、隐私或商业敏感信息 |
| 验证可行性 | 是否能用正例、反例、脚本或人工断言验证 |
数据质量等级:
- A:可直接创建 skill,进入 5 步通关和目录规划。
- B:可创建,但必须在
SKILL.md或交付说明中标注限制、待补输入和未验证项。 - C:只能先生成 skill 草案或方法论文档,不能声称已可稳定执行。
- D:不应创建 skill;先补真实案例、输入输出、边界或工具可用性。
证据链要求:每个创建或优化计划项都写成 问题 -> 证据等级 -> 改动对象 -> 动作 -> 验收 -> 风险。证据等级低于“中”时,优先补数据或补验证,不直接改高风险文件或接入外部写操作。
新建 Skill:5 步通关条件
阶段 0 的执行脚本在 references/5步引导流程.md。新建 skill 时必须按 Q1 到 Q5 顺序推进;任一题空泛就当场补问。没有结构化问答工具时,用普通编号选项让用户回复选项编号和补充说明。
5 步结果映射:
| 问题 | 写入位置 |
|---|---|
| Q1 现有做法 | ## 当前工作流(人工版) |
| Q2 具体步骤 | ## Skill 工作流(自动版) |
| Q3 方法论 | ## 核心原则 / 踩坑规避 |
| Q4 调用方式 | YAML description + ## 触发场景 |
| Q5 期望输出 | ## 输出规范 |
业务背景不单独提问,由用户原始需求、现有做法和痛点归纳生成。
快速试验例外:用户明确说“先快速试试”时,只问 Q2、Q5,但要说明结果可能偏空,后续需要补齐 Q1、Q3、Q4。
四类业务场景分流
用户原话或阶段 0 回答命中以下场景时,读取对应 reference,再继续问 Q2/Q3:
| 场景 | 何时使用 | 必读文件 |
|---|---|---|
| 选品开发 | 市场调研、竞品分析、利润测算、风险判断 | references/业务流程模板/选品开发流程.md |
| 关键词广告 | 关键词调研、排名追踪、广告结构、出价与否词 | references/业务流程模板/关键词广告流程.md |
| Listing 优化 | 标题、五点、A+、图片、关键词埋词 | references/业务流程模板/Listing优化流程.md |
| 日常运营监控 | 销量、广告、库存、差评、排名异常巡检 | references/业务流程模板/日常运营监控流程.md |
需要判断阈值时读取 references/行业指标标准/亚马逊运营指标手册.md。需要示例时读取 references/案例库/成功skill案例集.md。
MCP 集成指引
只在任务需要真实数据来源时读取 MCP 指南:
- Sorftime:读
references/MCP集成指南/sorftime-mcp-guide.md。适合关键词详情、关键词趋势、搜索结果、ASIN 在关键词下曝光排名。 - SIF:读
references/MCP集成指南/sif-mcp-guide.md。适合关键词需求、ABA 搜索量、广告 campaign/ad group 拆解、排名和广告贡献分析。 - SellerSprite:读
references/MCP集成指南/sellersprite-mcp-guide.md。适合 ASIN 详情、评论、BSR 预测、优惠趋势、关键词趋势、ABA 趋势。
MCP 指南用于指导“新 skill 未来怎么调用工具”,不是要求当前对话立刻调用这些工具。除非用户要现场验证,否则不要为了写 skill 而随意消耗 MCP 查询。
写 Skill 的主结构
新建或重写业务 skill 时,SKILL.md 使用下面结构:
# [Skill 名称]
## 业务背景
说明这个 skill 解决什么业务问题,以及不做会损失什么。
## 当前工作流(人工版)
列出现有人工流程、工具、耗时和痛点。
## Skill 工作流(自动版)
按步骤写清输入、处理、判断、输出;涉及 MCP 时写具体工具和参数来源。
## 核心原则 / 踩坑规避
写阈值、优先级、例外条件和安全边界。
## 触发场景
写 3-5 句用户真实会说的话。
## 输出规范
写产物类型、落点、命名规则、完成信号。
## 引用文件
说明何时读取 references、scripts 或 assets。
YAML frontmatter 只写 name 和 description。name 使用英文小写连字符;description 写“做什么 + 何时触发 + 不该触发边界”,不要只写一句功能名。
优化已有 Skill
当用户要求优化已有 skill 时:
- 先读取已有
SKILL.md、相关 references、scripts 和 README。 - 输出问题诊断:触发描述、流程可执行性、上下文体积、工具依赖、跨平台兼容、验证方式、数据质量等级和证据等级。
- 判断是否属于四类亚马逊场景;如果是,补充对应业务模板和 MCP 指南。
- 给出最小修改计划,计划项必须绑定
问题 -> 证据等级 -> 改动对象 -> 动作 -> 验收 -> 风险;用户要求实施时再编辑。 - 修改前保留副本或在工作副本中操作,避免破坏已安装版本。
优化时不要强迫用户重新回答 5 步问题;只补问缺失的高影响信息。
审查 / 体检输出规范
当用户要求 review、审查、诊断或体检已有 skill 时,必须输出完整诊断报告,不能只给总分、评级或几条泛泛建议。报告至少包含:
- 结论摘要:整体判断、主要风险和是否建议修改。
- 数据质量与证据等级:标注输入质量 A/B/C/D,并说明每条结论的证据等级是强 / 中 / 弱 / 冲突 / 无证据。
- 证据清单:每个问题都要引用触发描述、流程、引用文件、脚本、评测或安全边界中的具体证据。
- 风险排序:按红线、高 ROI、低风险优化排序,而不是按发现顺序罗列。
- ROI 修复清单:每条写清问题、动作、预期收益和验收方式。
- 待确认执行计划:每项包含问题、证据等级、改动对象、动作、验收方式和风险;用户只要求审查时不直接改文件,用户确认优化后再实施。
- 子 agent 判断:说明本次不启用 / 建议启用但需确认 / 禁止启用;未获用户明确确认前不得调用
spawn_agent,已启用意图也要评估是否建议取消。 - 验证与未运行项:说明已跑检查、未跑检查、失败原因和后续复验方式。
测试与评审
写完 skill 初稿后,准备 2-3 个真实测试 prompt。优先覆盖:
- 正常触发:用户用自然语言要求跑流程。
- 参数缺失:用户没给 ASIN、关键词、时间范围或文件路径。
- 边界场景:MCP 不可用、数据为空、指标进入预警/危险区间。
客观输出可写断言;主观输出用人工评审。断言就是判断输出合不合格的具体标准,例如“报告包含异常清单”“每条建议都有原因和动作”。
做触发或路由优化时,使用 evals/trigger-evals.json 运行 scripts/run_eval.py 或 scripts/run_loop.py;evals/evals.json 保留为人工评审和交付质量回归基准。新增场景或发现误触发时,先判断是触发路由问题还是交付质量问题,再补入对应基准文件并跑同批样例做回归。
Codex 跨平台命令
路径一律基于当前 skill 目录解析,不硬编码用户机器路径。
PowerShell 示例:
$skill = "path\to\skill"
uv run --with PyYAML python .\scripts\quick_validate.py $skill
python .\eval-viewer\generate_review.py $workspace --static $outputHtml
macOS/Linux shell 示例:
skill="path/to/skill"
uv run --with PyYAML python ./scripts/quick_validate.py "$skill"
python ./eval-viewer/generate_review.py "$workspace" --static "$output_html"
如果没有 uv,使用当前 Python 环境运行;缺少 PyYAML 时先安装到虚拟环境,不要污染受管理的系统 Python。
完成定义
一次创建或优化完成至少满足:
quick_validate.py通过。- 新增或修改的中文 Markdown 能用 UTF-8 正常读取。
description能覆盖真实触发话术,并避免明显误触发。- 输出规范包含产物形式、保存位置或完成信号。
- 交付说明包含 Skill 名称、路径、触发场景、不适用场景、输入要求、输出产物、目录结构、核心执行流程、已运行验证、未验证风险和后续迭代点。
- 至少完成一个正例、一个反例和一个最小执行验证;复杂 skill 追加 5-10 个 Golden Set、触发冲突审计或 forward-test。
- 涉及 MCP 的流程只引用当前可用工具,或明确标注“需确认安装”。
- 触发或路由相关修改能用
evals/trigger-evals.json跑通触发评测入口;若外部claudeCLI、认证或模型不可用,必须标注为未完成项,而不是把脚本入口失败当作评测结论。