Реагирование на инцидент
Отдели влияние от объяснения
- Установи затронутых пользователей или операции, серьёзность, время начала, текущие меры снижения воздействия и ответственного за реагирование. Используй существующую структуру реагирования, не придумывай новую команду для небольшого сбоя.
- Сопоставляй наблюдения по времени и компонентам. Сравни интервал сбоя с подходящим исходным уровнем и отметь пробелы охвата: недавняя строка лога или исправный экземпляр не объясняют весь инцидент.
- Отдельно отслеживай наблюдения, гипотезы о причинах и недостающие доказательства. Развёртывание перед появлением ошибок полезно как направление проверки, но не доказывает причинность.
Исследуй и стабилизируй
- Проследи путь сбойной пользовательской операции или данных до первого наблюдаемого расхождения. Сравни затронутые и незатронутые потоки, экземпляры или разделы, если это помогает различить гипотезы.
- Выбирай следующую диагностику по её способности различить правдоподобные причины. Сохраняй доказательства до того, как перезапуск или откат их изменит, не задерживая срочное разрешённое снижение воздействия.
- Для меры снижения воздействия укажи цель, ожидаемый эффект, возможный вред, условие остановки и способ отмены. Предпочитай минимальный эффективный охват и оцени результат до следующего изменения.
- Подтверждай восстановление репрезентативными запросами или проверками данных, а где применимо — также обработкой накопившейся очереди и восстановлением задержек. Снятого оповещения или успешного перезапуска недостаточно.
- После стабилизации различай временную меру, подтверждённую причину и устойчивое исправление. Назначай последующие действия, обоснованные доказательствами, включая недостающее обнаружение или инструкции runbook.
Результат
Укажи влияние, краткую хронологию, доказательства текущего объяснения, результаты действий и неразрешённые риски. Используй templates/incident-report.md, когда он доступен и полезен.
Очищай передаваемые доказательства от чувствительных данных, сохраняя технический смысл. Чувствительные оригиналы храни там, где требует политика проекта. Не расширяй задачу восстановления до несвязанных изменений конфигурации или библиотеки навыков.