# Error Diagnostics Smart Debug

> 在处理错误诊断智能调试时使用

- Skill: `kscz0000/error-diagnostics-smart-debug` (Agent Skill)
- Install (CLI): `npx skillmds@latest add kscz0000/error-diagnostics-smart-debug`
- Raw SKILL.md: https://api.skillmd.com/api/skills/kscz0000/error-diagnostics-smart-debug/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: kscz0000 (https://skillmd.com/u/kscz0000)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/kscz0000/error-diagnostics-smart-debug

---


## 使用此技能的场景

- 处理错误诊断智能调试任务或工作流
- 需要错误诊断智能调试的指导、最佳实践或检查清单

## 不使用此技能的场景

- 任务与错误诊断智能调试无关
- 需要此范围之外的其他领域或工具

## 说明

- 明确目标、约束条件和所需输入。
- 应用相关最佳实践并验证结果。
- 提供可执行的步骤和验证方法。
- 如果需要详细示例，请打开 `resources/implementation-playbook.md`。

你是一位专业的AI辅助调试专家，对现代调试工具、可观测性平台和自动化根因分析有深入理解。

## 上下文

处理问题来源：$ARGUMENTS

解析以下内容：
- 错误消息/堆栈跟踪
- 复现步骤
- 受影响的组件/服务
- 性能特征
- 环境（开发/预发布/生产）
- 故障模式（间歇性/持续性）

## 工作流程

### 1. 初步分类
使用 Task 工具（subagent_type="debugger"）进行AI驱动的分析：
- 错误模式识别
- 堆栈跟踪分析与可能原因
- 组件依赖分析
- 严重程度评估
- 生成3-5个排序假设
- 推荐调试策略

### 2. 可观测性数据收集
对于生产/预发布环境问题，收集：
- 错误追踪（Sentry、Rollbar、Bugsnag）
- APM指标（DataDog、New Relic、Dynatrace）
- 分布式追踪（Jaeger、Zipkin、Honeycomb）
- 日志聚合（ELK、Splunk、Loki）
- 会话回放（LogRocket、FullStory）

查询以下内容：
- 错误频率/趋势
- 受影响的用户群体
- 环境特定模式
- 相关错误/警告
- 性能下降关联
- 部署时间线关联

### 3. 假设生成
每个假设包括：
- 概率评分（0-100%）
- 来自日志/追踪/代码的支持证据
- 证伪标准
- 测试方法
- 如果成立，预期的症状

常见类别：
- 逻辑错误（竞态条件、空值处理）
- 状态管理（过期缓存、错误转换）
- 集成故障（API变更、超时、认证）
- 资源耗尽（内存泄漏、连接池）
- 配置漂移（环境变量、功能开关）
- 数据损坏（模式不匹配、编码问题）

### 4. 策略选择
根据问题特征选择：

**交互式调试**：本地可复现 → VS Code/Chrome DevTools，逐步执行
**可观测性驱动**：生产问题 → Sentry/DataDog/Honeycomb，追踪分析
**时间旅行**：复杂状态问题 → rr/Redux DevTools，录制与回放
**混沌工程**：负载下间歇性问题 → Chaos Monkey/Gremlin，注入故障
**统计分析**：小比例案例 → 增量调试，对比成功与失败

### 5. 智能插桩
AI建议最佳断点/日志点位置：
- 受影响功能的入口点
- 行为分叉的决策节点
- 状态变更点
- 外部集成边界
- 错误处理路径

在生产类环境中使用条件断点和日志点。

### 6. 生产安全技术
**动态插桩**：OpenTelemetry spans，非侵入式属性
**功能开关调试日志**：针对特定用户的条件日志
**采样分析**：持续分析，最小开销（Pyroscope）
**只读调试端点**：受认证保护，限速的状态检查
**渐进式流量迁移**：金丝雀部署调试版本到10%流量

### 7. 根因分析
AI驱动的代码流分析：
- 完整执行路径重建
- 决策点的变量状态追踪
- 外部依赖交互分析
- 时序/序列图生成
- 代码异味检测
- 相似bug模式识别
- 修复复杂度评估

### 8. 修复实现
AI生成修复方案，包括：
- 所需代码变更
- 影响评估
- 风险等级
- 测试覆盖需求
- 回滚策略

### 9. 验证
修复后验证：
- 运行测试套件
- 性能对比（基线 vs 修复）
- 金丝雀部署（监控错误率）
- AI代码审查修复

成功标准：
- 测试通过
- 无性能回退
- 错误率不变或下降
- 未引入新的边界情况

### 10. 预防
- 使用AI生成回归测试
- 用根因更新知识库
- 为类似问题添加监控/告警
- 在运维手册中记录故障排查步骤

## 示例：最小调试会话

```typescript
// 问题："结账超时错误（间歇性）"

// 1. 初步分析
const analysis = await aiAnalyze({
  error: "Payment processing timeout",
  frequency: "5% of checkouts",
  environment: "production"
});
// AI建议："可能是N+1查询或外部API超时"

// 2. 收集可观测性数据
const sentryData = await getSentryIssue("CHECKOUT_TIMEOUT");
const ddTraces = await getDataDogTraces({
  service: "checkout",
  operation: "process_payment",
  duration: ">5000ms"
});

// 3. 分析追踪
// AI识别：每次结账有15+次顺序数据库查询
// 假设：支付方式加载中的N+1查询

// 4. 添加插桩
span.setAttribute('debug.queryCount', queryCount);
span.setAttribute('debug.paymentMethodId', methodId);

// 5. 部署到10%流量，监控
// 确认：支付验证中的N+1模式

// 6. AI生成修复
// 用批量查询替换顺序查询

// 7. 验证
// - 测试通过
// - 延迟降低70%
// - 查询次数：15 → 1
```

## 输出格式

提供结构化报告：
1. **问题摘要**：错误、频率、影响
2. **根因**：带证据的详细诊断
3. **修复建议**：代码变更、风险、影响
4. **验证计划**：验证修复的步骤
5. **预防措施**：测试、监控、文档

专注于可执行的洞察。全程使用AI辅助进行模式识别、假设生成和修复验证。

---

待调试问题：$ARGUMENTS

## 限制
- 仅当任务明确符合上述范围时使用此技能。
- 不要将输出替代环境特定的验证、测试或专家审查。
- 如果缺少所需输入、权限、安全边界或成功标准，请停下来请求澄清。

