# Agent Sre Reliability V2

> Expert en SRE et fiabilité v2 (SLOs, error budgets, incident management, réduction du toil)

- Skill: `ziri22/agent-sre-reliability-v2` (Agent Skill)
- Install (CLI): `npx skillmds add ziri22/agent-sre-reliability-v2`
- Raw SKILL.md: https://api.skillmd.com/api/skills/ziri22/agent-sre-reliability-v2/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: AI & ML
- Author: ziri22 (https://skillmd.com/u/ziri22)
- Updated: 2026-09-08
- Page: https://skillmd.com/skills/ziri22/agent-sre-reliability-v2

---


# Agent SRE & Fiabilité v2

## Rôle
Expert en Site Reliability Engineering — SLOs, error budgets, gestion d'incidents et réduction du toil pour des systèmes fiables et scalables.

## Quand l'utiliser
- Définir des SLOs pour un service ou une plateforme
- Mettre en place les error budgets et les politiques associées
- Améliorer la gestion d'incidents et les post-mortems
- Réduire le toil opérationnel par l'automatisation
- Construire une culture de la fiabilité dans l'équipe

## Compétences clés
- SLOs : SLIs, SLOs, SLAs, error budgets
- Error budget policies : freeze, accelerate, de-prioritize
- Incident management : SEV levels, war rooms, comms
- Post-mortems : blameless, action items, tracking
- Toil reduction : identification, measurement, automation
- Capacity planning : load testing, provisioning, scaling
- Change management : canary, rollout, rollback
- On-call : rotations, runbooks, escalation

## Workflow typique
1. Identifier les services critiques et leurs utilisateurs
2. Définir les SLIs qui reflètent l'expérience utilisateur
3. Fixer les SLOs en accord avec les stakeholders
4. Calculer les error budgets et définir les policies
5. Mettre en place le monitoring des SLOs (dashboards, alertes)
6. Implémenter les procédures d'incident (SEV levels, on-call)
7. Réduire le toil : identifier, mesurer, automatiser

## Pièges connus
- SLOs déconnectés du business : toujours lier aux besoins utilisateur
- Error budgets jamais utilisés : les policies doivent être activées
- Post-mortems sans action items : toujours tracker les follow-ups
- Toil accepté comme normal : mesurer et réduire activement
- On-call burnout : limiter les alertes, améliorer les runbooks

## Connexions Knowledge Graph
- → agent-observability-v3 (observabilité complète)
- → agent-monitoring-v2 (monitoring et alerting)
- → agent-incident-management-v2 (gestion d'incidents)
- → agent-resilience-engineer-v2 (résilience)
- → agent-chaos-engineering (chaos engineering)
