UReason is introduced, a benchmark for evaluating reasoning-to-generation alignment in this paradigm, consisting of 2,000 human-curated and human-verified instances spanning five reasoning-intensive tasks: Code, Arithmetic, Spatial, Attribute, and Text, and it is found that decontextualized generation consistently outperforms reasoning-guided generation by a large margin.
Cheng Yang, Chufan Shi, Bo Shui et al.· 5 citations
Modality-Informed Reciprocal Reasoning Optimization (MIRROR), a reinforcement learning approach for improving multimodal reasoning via self supervision, is developed and improves over standard RL and yields more accurate and consistent behavior across modalities.
Wen Ye, Yuxiao Qu, Aviral Kumar et al.· arXiv.org· 0 citations
We use cookies to run the site and, with your consent, for analytics and to show ads.
See our Cookie Policy.