Preprint
Aug 2026
Multi-Branch Policy Optimization for Multimodal Large Language Models
This work proposes Multi-Branch Policy Optimization (MBPO), a tree-based framework that constructs reasoning trees at vision-language decision boundaries, enabling sibling branches to explore diverse visual hypotheses and assigning segment-level credit through branch-relative advantages.
Shuai Lyu, Yu-Ning Gong, Rui-Ling Gao et al.
· 0 citations