Cuda Attention Kernel Patterns

Patterns and pitfalls for the ONNX domain Attention operator (opset 23/24) CUDA implementation. Use when modifying the dispatch cascade in core/providers/cuda/llm/attention.cc, writing mask/bias CUDA kernels, debugging attention test routing, or adding features to the ONNX Attention op. NOT for contrib domain MultiHeadAttention/GroupQueryAttention.

Microsoft 6d916a7 25.7 KB Updated 2.7k repo stars

File contents

microsoft/onnxruntime/tree/main/.github/skills/cuda-attention-kernel-patterns commit 6d916a73e8

Frequently asked questions

npx skillmds@latest add microsoft/cuda-attention-kernel-patterns