Infra Prometheus Optimization

Prometheus optimization — recording rules (level:metric:operations naming), cardinality explosion diagnosis (tsdb status API), scrape interval tuning, remote write configuration (batch size/queue capacity), Thanos/Mimir for long-term retention, federation vs remote write, AlertManager routing trees (inhibition/silencing), absent() alerts for missing series, relabeling to drop expensive labels, TSDB compaction, ServiceMonitor vs PodMonitor patterns

ivanshamaev Updated

File contents

ivanshamaev/de-agent-skills/tree/main/group_skills/infra_dataops_group_skills/infra_prometheus_optimization commit 8bfc38323b

Frequently asked questions

npx skillmds@latest add ivanshamaev/infra-prometheus-optimization