Dra Operations Troubleshooting Observability

Guide triage of install, allocation, scheduling, runtime injection, plugin, controller, daemon, metric, and upgrade failures in the NVIDIA DRA Driver for GPUs. Use when a user provides logs, symptoms, failed pods, broken claims, missing devices, cluster events, or a support escalation.

kubernetes-sigs Updated

File contents

kubernetes-sigs/dra-driver-nvidia-gpu/tree/main/.agents/skills/dra-operations-troubleshooting-observability commit 812a566618

Frequently asked questions

npx skillmds@latest add kubernetes-sigs/dra-operations-troubleshooting-observability