# Observability Setup

> Определить или улучшить эксплуатационные сигналы, дашборды и оповещения для конкретной операции сервиса или вида отказа. Использовать для проектирования и проверки мониторинга, а не простого чтения дашборда во время диагностики.

- Skill: `fbakiyev/observability-setup` (Agent Skill)
- Install (CLI): `npx skillmds@latest add fbakiyev/observability-setup`
- Raw SKILL.md: https://api.skillmd.com/api/skills/fbakiyev/observability-setup/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: fbakiyev (https://skillmd.com/u/fbakiyev)
- Updated: 2026-09-21
- Page: https://skillmd.com/skills/fbakiyev/observability-setup

---


# Настройка наблюдаемости

## Определи смысл сигналов

- Начни с пользовательской операции или результата обработки данных, которые нужно защитить. Состояние инфраструктуры служит дополнительным доказательством, если запросы, корректность или свежесть данных могут нарушаться независимо от него.
- Определи правила включения событий, числитель, знаменатель, единицы, окно и значимые измерения. Различай отсутствие телеметрии, отсутствие трафика и нулевое число сбоев.
- Установи точку измерения и слепые зоны. Выборка, повторы, исключённые запросы и синтетический трафик могут менять смысл внешне благополучной доли успеха.

## Построй полезный путь реагирования

1. Выбери метрики влияния и динамики, а логи и трассировки — под вопросы, на которые они действительно отвечают. Сохраняй связь событий между компонентами, не собирая секреты или ненужные персональные значения.
2. Для совокупных долей объединяй совместимые количества событий. Не усредняй перцентили экземпляров и не смешивай несвязанные совокупности в один показатель здоровья.
3. Выбирай пороги и окна оповещения исходя из цели сервиса и требуемого действия. Учитывай малый трафик, краткие всплески, устойчивую деградацию, отсутствие данных и запаздывание поступления.
4. Ограничивай кардинальность меток и срок хранения. Идентификаторы с неограниченным числом значений помещай в подходящее диагностическое хранилище, не создавай временной ряд для каждого запроса или пользователя.
5. Свяжи оповещения с ответственным и практическим действием. Отделяй срочное вмешательство от отложенной работы и проверяй дублирование уведомлений при отказе общей зависимости.

## Проверь и передай результат

Оцени правила на репрезентативных примерах нормальной работы, сбоя, восстановления и отсутствия данных. Если доступен разрешённый интеграционный тест, отдельно от корректности выражений проверь доставку уведомлений и их маршрутизацию.

Верни определения сигналов, реализованные запросы или конфигурацию, доказательства проверок и оставшиеся слепые зоны. Используй `templates/observability.md`, если он доступен и полезен. Не утверждай, что дашборды или вызов дежурного работают, только по синтаксису конфигурации.

Для компромиссов оповещения на основе SLO используй [рекомендации Google SRE](https://sre.google/workbook/alerting-on-slos/), адаптируя примеры к фактическому трафику и цели.

