Gemm Kernel Optimization

Optimize dense matrix multiplication (GEMM) kernels in Triton for NVIDIA and AMD GPUs. Covers tiled blocking, L2 cache grouping, tensor core utilization, and dual-platform autotune. Use when writing or optimizing matmul, linear layers, or any GEMM-based kernel.

ZJLi2013 Updated

File contents

ZJLi2013/awesome-kernel-skills/tree/main/skills/kernels/gemm commit 2646bea2bd

Frequently asked questions

npx skillmds@latest add zjli2013/gemm-kernel-optimization