FlashAttention for Scalable Vector Architectures
This paper presents FlashAttention-V, a blocked FlashAttention for scalable vector architectures that adapts efficiently from short to very long vectors by exploiting parallelism across attention heads, inter-head packing to enable efficient utilization of vector lengths beyond the head dimension, and improving vector register utilization and memory access locality.
Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs
· 0 citations