跳到主要内容

Attention Kernel

Attention Kernel 关注 Q、K、V 之间的计算、softmax 稳定性和显存访问。

核心问题

  • Attention 的计算瓶颈在哪里?
  • softmax 如何保持数值稳定?
  • 如何减少中间矩阵的显存读写?

笔记模板

  • 输入形状。
  • 计算流程。
  • 中间状态。
  • 数值稳定性。
  • 并行映射。
  • 性能指标。