Gke Inference

Deploys and optimizes AI/ML inference workloads on GKE, using GPUs, TPUs, and model servers. Use when deploying GKE inference servers, configuring GKE GPU resources for inference, or deploying LLMs on GKE. Don't use for generic batch jobs or HPC task queues (use gke-batch-hpc instead).

h3y6e 8285f85 7.3 KB Updated

File contents

h3y6e/agent-skills/tree/main/.vendor/skills/gke-inference commit 8285f85e5b

Frequently asked questions

npx skillmds@latest add h3y6e/gke-inference