Open access
Jul 2026
MMViT: Bridging Mamba and Attention for efficient video action recognition in sports.
This paper proposes MMViT (Multi-scale Mamba Visual Transformer) with a hierarchical design for improved recognition and objective efficiency and introduces a computation-downsampling decoupling (CDD) mechanism to preserve feature coverage during Mamba spatial scaling change.
Jie Dai, Zi-Yi Quan, Yunxiang Zheng et al.
· Scientific Reports · 0 citations