# 链路追踪分析Skill

> 分布式链路追踪的采样策略、traceId 关联规则与慢调用/异常调用定位方法。当需要跨服务还原一次请求的完整调用链路并定位瓶颈时使用。

- Skill: `sky-cube/skill-12` (Agent Skill)
- Install (CLI): `npx skillmds@latest add sky-cube/skill-12`
- Raw SKILL.md: https://api.skillmd.com/api/skills/sky-cube/skill-12/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: Sky-Cube (https://skillmd.com/u/sky-cube)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/sky-cube/skill-12

---

# 链路追踪分析Skill

## 适用场景
分布式系统下,单次请求跨多个服务,需要还原完整调用链路,定位慢调用、异常调用与依赖瓶颈。

## 执行步骤
1. 确认链路上下文:拿到用户报障的 traceId/请求ID/时间窗,作为分析起点。
2. 还原调用拓扑:按时间轴展开各服务节点(spans),标出调用顺序、耗时占比、异常标记。
3. 定位异常节点:优先看错误 span 与最长耗时 span,判断是业务慢、依赖慢还是排队等待。
4. 关联日志与指标:用 traceId 关联各服务日志,交叉核对该时段的 CPU/RT/错误率指标。
5. 制定采样策略:高流量链路按错误/慢调用必采 + 正常请求比例采样,低流量可全采;参数以所用追踪组件官方文档为准。
6. 输出分析结论:瓶颈节点、根因假设、待验证证据、优化建议。

## 规范要点
- traceId 必须贯通:网关生成或透传,服务间不得断链,落日志统一格式。
- 判定要证据化:耗时异常必须结合日志与指标交叉验证,禁止只看单点数据下结论。
- 数据脱敏:链路数据中的参数、报文体可能含敏感信息,采集端需脱敏或关闭 body 采集。
- 保留策略:链路数据按合规要求设定保留周期,过期自动清理,禁止无限留存。
- 安全红线:临时调整采样率、开启全量采集、导出原始链路数据等操作需「总控 + 安全合规」双签名审批,并全程留痕。

## 输出模板
```
## 链路分析报告
traceId / 调用拓扑与时间轴 / 异常或慢调用节点定位 / 日志与指标交叉证据 / 根因假设 / 优化建议
```

## 自检清单
- [ ] 链路完整无断点(traceId 全链路贯通)
- [ ] 定位结论有日志+指标双重证据
- [ ] 采集数据已考虑脱敏与保留周期
- [ ] 调整采集策略具备双签名审批

