# Monitoring Observability

> Three pillars of observability. Metrics (Prometheus), logs (structured), traces (OpenTelemetry).

- Skill: `aselimc/monitoring-observability` (Agent Skill)
- Install (CLI): `npx skillmds@latest add aselimc/monitoring-observability`
- Raw SKILL.md: https://api.skillmd.com/api/skills/aselimc/monitoring-observability/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Coding & Dev Tools
- Author: aselimc (https://skillmd.com/u/aselimc)
- Updated: 2026-09-10
- Page: https://skillmd.com/skills/aselimc/monitoring-observability

---


# Monitoring & Observability

## Three Pillars
1. **Metrics**: Prometheus + Grafana dashboards
2. **Logs**: structured JSON -> Loki/ELK
3. **Traces**: OpenTelemetry for distributed tracing

## Key Metrics
- **Services**: request rate, error rate, latency (p50/p95/p99)
- **ML models**: prediction latency, throughput, accuracy drift
- **GPU**: utilization %, memory usage, temperature
- **Data**: drift detection (Evidently), schema validation

## Alerting
- Critical: page on-call (PagerDuty/Opsgenie)
- Warning: Slack notification
- Info: dashboard only
- Avoid alert fatigue: tune thresholds, group related alerts

## ML-Specific Monitoring
```python
from evidently import Report
from evidently.metrics import DataDriftPreset
report = Report(metrics=[DataDriftPreset()])
report.run(reference_data=train_df, current_data=prod_df)
```

## Key Libraries
Prometheus, Grafana, OpenTelemetry, Evidently, Loki

