Triton Ascend Attention

适用于注意力(attention)机制类算子的优化指南。当算子的核心计算是 Transformer 风格的注意力运算时应选择此指南,典型算子包括:self_attention, cross_attention, multi_head_attention, flash_attention, scaled_dot_product_attention, causal_attention, masked_attention 等。涵盖 QKV 矩阵乘分块、在线 softmax、因果 mask 处理、Flash Attention 分块策略等关键技巧。不适用于不含注意力结构的普通矩阵乘法或归约运算。

wenyi-li Updated

File contents

wenyi-li/awesome-agent-kernel-skills/tree/main/triton-ascend-attention commit b792c9c220

Frequently asked questions

npx skillmds@latest add wenyi-li/triton-ascend-attention