Triton Cuda Matmul

矩阵乘法算子(matmul/bmm/linear)优化策略,包括分块 Tiling、共享内存缓存、Tensor Core 利用和大矩阵处理技巧。适用于实现 GEMM、批量矩阵乘、全连接层等矩阵运算的 CUDA 内核代码生成场景

wenyi-li Updated

File contents

wenyi-li/awesome-agent-kernel-skills/tree/main/triton-cuda-matmul commit 4bb9a72b2e

Frequently asked questions

npx skillmds@latest add wenyi-li/triton-cuda-matmul