Preprint
Aug 2026
Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
Experimental results demonstrate that S2V can consistently improve LVU performance across multiple LVU benchmarks, outperforming both general MLLMs and reasoning-based methods not only in LVU accuracy but also in training and inference efficiency.
Beibei Zhang, Chao Xu, Jun Lan et al.
· 0 citations