Jul 2026
Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
This paper introduces training-free Sol-Attn (Sparsifying online attention), which unifies dynamic routing, sparse computation, and approximation correction in a single online-softmax pass, achieving a better accuracy-efficiency trade-off in sparse attention.
Haopeng Li, Yitong Li, Junsong Chen et al.
· arXiv.org · 2 citations