Multi-Agent Self-Improving Reinforcement Learning for Video Reasoning
The results support frozen verification as a training signal for evidence selection, while showing that strict boundary precision remains comparatively weaker.
Ming-Wen Zhang, Jisheng Dang, Minqiang Yang et al.
· 0 citations