Jul 2026
Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
A diagnostic toolkit for auditing what benchmark scores for open-source Video-LLM models actually measure, and finds the accuracy does not come from character tracking.
Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar et al.
· arXiv.org · 0 citations