链路追踪分析Skill

分布式链路追踪的采样策略、traceId 关联规则与慢调用/异常调用定位方法。当需要跨服务还原一次请求的完整调用链路并定位瓶颈时使用。

Sky-Cube 52c1431 2.0 KB Updated

File contents

链路追踪分析Skill

适用场景

分布式系统下,单次请求跨多个服务,需要还原完整调用链路,定位慢调用、异常调用与依赖瓶颈。

执行步骤

  1. 确认链路上下文:拿到用户报障的 traceId/请求ID/时间窗,作为分析起点。
  2. 还原调用拓扑:按时间轴展开各服务节点(spans),标出调用顺序、耗时占比、异常标记。
  3. 定位异常节点:优先看错误 span 与最长耗时 span,判断是业务慢、依赖慢还是排队等待。
  4. 关联日志与指标:用 traceId 关联各服务日志,交叉核对该时段的 CPU/RT/错误率指标。
  5. 制定采样策略:高流量链路按错误/慢调用必采 + 正常请求比例采样,低流量可全采;参数以所用追踪组件官方文档为准。
  6. 输出分析结论:瓶颈节点、根因假设、待验证证据、优化建议。

规范要点

  • traceId 必须贯通:网关生成或透传,服务间不得断链,落日志统一格式。
  • 判定要证据化:耗时异常必须结合日志与指标交叉验证,禁止只看单点数据下结论。
  • 数据脱敏:链路数据中的参数、报文体可能含敏感信息,采集端需脱敏或关闭 body 采集。
  • 保留策略:链路数据按合规要求设定保留周期,过期自动清理,禁止无限留存。
  • 安全红线:临时调整采样率、开启全量采集、导出原始链路数据等操作需「总控 + 安全合规」双签名审批,并全程留痕。

输出模板

## 链路分析报告
traceId / 调用拓扑与时间轴 / 异常或慢调用节点定位 / 日志与指标交叉证据 / 根因假设 / 优化建议

自检清单

  • 链路完整无断点(traceId 全链路贯通)
  • 定位结论有日志+指标双重证据
  • 采集数据已考虑脱敏与保留周期
  • 调整采集策略具备双签名审批

Sky-Cube/fullflow-dev-agent/tree/main/.claude/skills/trace-analysis commit 52c1431a28

Frequently asked questions

npx skillmds@latest add sky-cube/skill-12