Databricks Platform Reliability

Use this skill to diagnose and design platform reliability using system-table evidence, job and pipeline execution review, cluster policies, instance pools, quota headroom, and disaster-recovery posture: job timeouts and retries, run-history retention, managed DR design, incident-evidence preservation, and quota limits. Reads job and pipeline definitions, cluster policies, system-table schemas, and incident logs; never executes queries or triggers live operations.

VincentChuWaiChow c620494 7 files · 30.3 KB Updated

File contents

VincentChuWaiChow/vanguard-frontier-agentic/tree/main/skills/databricks/databricks-platform-reliability commit c620494447

Frequently asked questions

npx skillmds@latest add vincentchuwaichow/databricks-platform-reliability