Optimize LLM Inference

Runs workflows for GPU/inference talks — Groq LPU latency, OSS inference stacks, MoE networking, serverless fine-tune, frontier cluster design, Devin agent infra, Gemma sizing. Use when optimizing inference $/token, training networks, or picking open models.

hiteshbandhu Updated

File contents

hiteshbandhu/skills-i-use/tree/main/skills/ai-engineer-talks/optimize-llm-inference commit 5e02f15168

Frequently asked questions

npx skillmds@latest add hiteshbandhu/optimize-llm-inference