Flash Attention Kernel

Optimize FlashAttention-style fused attention kernels in Triton for NVIDIA and AMD GPUs. Covers online softmax, tiled QK/AV GEMM, causal masking, and memory-efficient attention. Use when writing or optimizing self-attention, cross-attention, or any QKV attention kernel.

ZJLi2013 Updated

File contents

ZJLi2013/awesome-kernel-skills/tree/main/skills/kernels/flash-attention commit a01db739dd

Frequently asked questions

npx skillmds@latest add zjli2013/flash-attention-kernel