# Devops Guide

> DevOps/运维工程师方案产出指南。当用户提出运维、CI/CD、容器化、云基础设施、监控告警相关需求时触发。覆盖场景：基础设施搭建、CI/CD流程设计与优化、容器化编排、云架构设计、监控日志体系搭建、灾备方案、IaC、成本优化。先识别需求属于5类场景中的哪一类（0到1基础设施搭建/中型运维改造/小优化故障修复/大版本架构迁移/技术预研选型），再按对应场景的产出清单生成完整方案。触发词：CI/CD、DevOps、Kubernetes、Docker、监控、告警、日志、云架构、容器化、Terraform、灾备、高可用、成本优化、运维方案。

- Skill: `genapohub/devops-guide` (Agent Skill, multi-file: 4 files)
- Install (CLI): `npx skillmds@latest add genapohub/devops-guide`
- Raw SKILL.md: https://api.skillmd.com/api/skills/genapohub/devops-guide/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: DevOps & Infra
- Author: genapohub (https://skillmd.com/u/genapohub)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/genapohub/devops-guide

---


# DevOps / 运维工程师方案产出指南

## Overview

本技能将 DevOps 领域的方法论转化为可执行的工作流。当用户提出运维相关需求时，先识别该需求属于 5 类场景中的哪一类，再按对应场景的产出清单生成完整方案——从基础设施搭建到灾备方案，覆盖运维工程的全生命周期。

详细的方法论、各场景产出清单、CI/CD规范、K8s最佳实践、监控SLO、安全基线、质量检查清单均存放在 `references/DevOps方法论.md`，在执行前必须读取对应章节。

## 触发条件

- 用户需要搭建 CI/CD Pipeline 或改造现有流程
- 用户需要设计容器化方案或 Kubernetes 配置
- 用户需要搭建监控、日志、告警体系
- 用户需要云基础设施规划或迁移
- 用户提到"CI/CD""DevOps""K8s""Docker""监控告警""日志""灾备""IaC""Terraform""运维"等关键词

## 记忆系统

本技能的完整记忆管理规则（写日志/轮转归档/自清理）定义在 `references/记忆规则.md`，执行前必须读取。

- **执行前（必须）**：读取 `references/记忆规则.md` 中的 Step 0 加载规范 + `.skills-memory/MEMORY.md` 本技能对应分段 + `.skills-memory/YYYY-MM-DD.md`（今日日志，如存在）
- **执行后（硬性要求，不可跳过）**：追加 `[devops-guide] 场景描述 → 关键决策` 到 `.skills-memory/YYYY-MM-DD.md`；如有可复用决策，去重后追加到 MEMORY.md 对应分段。**记忆写入是交付物的一部分**——如果因环境限制无法写入，必须在最终回复中明确告知用户「记忆未写入」及原因，不得静默跳过
- **轮转检查**：
  - **独立使用**：按 `references/记忆规则.md` 中的触发条件和完整轮转算法执行归档
  - **被 team-orchestrator 调度时**：跳过全部记忆操作（写入 + 轮转），由调度官 Step 6（写日志）/ Step 7（轮转归档）统一处理

## 执行流程

按以下 5 步顺序执行，不可跳步。

### Step 1: 需求理解

- 解析用户输入的运维需求
- 提取关键信息：基础设施现状、云平台、容器化程度、监控现状、团队规模、可用性目标、预算约束
- 识别缺失的关键信息，主动提问补全（一次最多 2-3 个问题）

### Step 2: 场景识别

读取 `references/DevOps方法论.md` 的"一、场景识别"章节判断场景：

| 场景 | 名称 | 判断条件 | 产出量 |
|------|------|---------|--------|
| 场景一 | 0→1 基础设施搭建 | 全新项目、无CI/CD、无监控 | 10-12类 |
| 场景二 | 中型运维改造/优化 | 已有基础设施新增模块、CI/CD改造 | 6-8类 |
| 场景三 | 小优化/故障修复 | 单条Pipeline修复、告警调整 | 2-3类 |
| 场景四 | 大版本架构迁移 | 云平台迁移、K8s升级、工具链替换 | 8-10类 |
| 场景五 | 技术预研/选型 | 新工具评估、成本优化PoC | 3-4类 |

### Step 3: 与用户确认场景

输出场景判断、判断依据、产出清单、预估周期，确认后进入产出。

### Step 4: 按清单产出方案

读取 `references/DevOps方法论.md` 对应场景章节。

> **专家蒸馏增量（2026-09-06 并入）**：MVP/快速项目的部署交付方案，兜底检查四条底线——部署后可验证（/health + 页面 200 + 核心流程）、可回滚（上一版镜像保留）、数据有备份（每日 + 每月验证）、交付自包含（.env.example + DEPLOY.md + 一键启动）。详见 `references/expert-distill/mvp-devops-蒸馏.md`。进入**生产级基础设施运维**（非 MVP 部署）时，另读取 `references/expert-distill/infra-ops-蒸馏.md`（运维通：监控告警量化阈值 CPU>80%/内存>90%/磁盘>85%/服务宕、备份七要素=加密+异地+验证+清理+通知+错误处理+分层、IaC 纪律、健康报告模板、运维量化指标 99.9%/MTTR<4h）。

产出要求：
- 架构图使用 Mermaid 或 ASCII 描述（网络拓扑/部署拓扑/数据流）
- Pipeline 定义给出完整的 YAML 配置示例（GitHub Actions/GitLab CI）
- K8s 配置给出完整的 YAML manifest（Deployment/Service/HPA/PDB）
- 监控告警给出具体指标 + 阈值 + 通知方式
- 遵循"七、DevOps 通用规范"
- **必须读取并应用"十一、超越AI味"章节**：产出方案时融入真实岗位经验，拒绝模板化输出
- **优先使用可填空模板**：方法论通用规范章节末尾的「### XX模板（可填空）」，直接按占位符填充（无对应模板则按清单产出）
- 产出后保存为 Markdown 文件

### Step 5: 质量检查

读取 `references/DevOps方法论.md` 的"十、产出质量检查清单"：

- CI/CD Pipeline 覆盖 Build→Test→Scan→Deploy 全流程
- 容器化符合最佳实践（多阶段构建/非root/资源限制）
- 监控覆盖 Metrics + Logs + Traces
- 告警分级明确 + 通知渠道
- 灾备方案含 RPO/RTO + 演练计划
- 安全覆盖镜像/网络/密钥/审计
- 回滚方案可执行

- **去AI味**：对照"十一、超越AI味"逐条自检，拒绝模板化产出
- 记忆已写入（`.skills-memory/YYYY-MM-DD.md` 有本次会话条目，无则立即补写）

## 资源说明

### references/DevOps方法论.md

完整的方法论文档，包含：5个场景产出清单、CI/CD规范、Docker最佳实践、K8s资源规范、监控SLO参考、安全基线、质量检查清单。

## 注意事项

- 不要跳过 Step 3 的用户确认
- Pipeline 必须覆盖安全性检查（镜像扫描/依赖扫描）
- 容器必须配置资源限制（Request/Limit），不加限制是安全隐患
- 告警必须分级 + 指定通知渠道 + 定义升级策略
- 灾备方案不能停在纸面，必须含演练计划
- 场景四（架构迁移）的回滚预案是硬性要求

## 岗位职责与产出标准（业界锚点 · 2026-08 学习）

**现实岗位职责**：①CI/CD 流水线设计与运维——持续集成/持续交付/自动化部署；②基础设施即代码（IaC）——Terraform/Ansible 管理云资源；③容器化与编排——Docker/K8s 部署维护；④监控告警与可观测性——Prometheus/Grafana/ELK；⑤故障响应与根因分析——事故复盘闭环；⑥安全合规——扫描/密钥管理/最小权限；⑦减少 toil——自动化/自助服务/runbook 沉淀。

**业界产出标准**：CI/CD 模板、IaC 模块与环境栈、Helm charts、监控看板与告警规则、runbook、事故复盘报告（postmortem）、安全扫描集成。质量要求（DORA 指标）：部署频率、变更前置时间、变更失败率、MTTR（恢复时长）持续改善；SLO 达标；告警噪音率低。

交付衔接：运维方案交付给开发（CI/CD配置/环境信息）+ QA（测试环境搭建）+ 项目管理（上线计划）
