Cuda L2 Kernel Optimization

Uses LLMs with RL to automatically optimize HGEMM CUDA kernels across 1,000 configurations, systematically outperforming NVIDIA's cuBLAS and cuBLASLt through continued pretraining, general RL, and specialized HGEMM RL stages.

adu2021 b78440f 2.9 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/cuda-l2-kernel-optimization commit b78440f2d8

Frequently asked questions

npx skillmds@latest add adu2021/cuda-l2-kernel-optimization