Preprint
Aug 2026
Contrastive Branch Policy Optimization
Requiring only outcome rewards and no process-level annotation, CBPO provides a practical solution for fine-grained credit assignment in tool-integrated agent training and consistently outperforms state-of-the-art policy-optimization and branch-based methods.
Ying Wang, Changlin Qiu, Bang Lin et al.
· 0 citations