链路追踪分析Skill
适用场景
分布式系统下,单次请求跨多个服务,需要还原完整调用链路,定位慢调用、异常调用与依赖瓶颈。
执行步骤
- 确认链路上下文:拿到用户报障的 traceId/请求ID/时间窗,作为分析起点。
- 还原调用拓扑:按时间轴展开各服务节点(spans),标出调用顺序、耗时占比、异常标记。
- 定位异常节点:优先看错误 span 与最长耗时 span,判断是业务慢、依赖慢还是排队等待。
- 关联日志与指标:用 traceId 关联各服务日志,交叉核对该时段的 CPU/RT/错误率指标。
- 制定采样策略:高流量链路按错误/慢调用必采 + 正常请求比例采样,低流量可全采;参数以所用追踪组件官方文档为准。
- 输出分析结论:瓶颈节点、根因假设、待验证证据、优化建议。
规范要点
- traceId 必须贯通:网关生成或透传,服务间不得断链,落日志统一格式。
- 判定要证据化:耗时异常必须结合日志与指标交叉验证,禁止只看单点数据下结论。
- 数据脱敏:链路数据中的参数、报文体可能含敏感信息,采集端需脱敏或关闭 body 采集。
- 保留策略:链路数据按合规要求设定保留周期,过期自动清理,禁止无限留存。
- 安全红线:临时调整采样率、开启全量采集、导出原始链路数据等操作需「总控 + 安全合规」双签名审批,并全程留痕。
输出模板
## 链路分析报告
traceId / 调用拓扑与时间轴 / 异常或慢调用节点定位 / 日志与指标交叉证据 / 根因假设 / 优化建议
自检清单
- 链路完整无断点(traceId 全链路贯通)
- 定位结论有日志+指标双重证据
- 采集数据已考虑脱敏与保留周期
- 调整采集策略具备双签名审批