Preprint
Sep 2026
GR2PO: Group Relative Return Policy Optimization for Continuous Robot Control
Group Relative Return Policy Optimization (GR2PO), a critic-free reinforcement learning framework for continuous robot control, is proposed and significantly outperforms critic-free baselines that use immediate rewards and performs competitively against state-of-the-art actor-critic methods.
Pengqin Wang, Qi-Ming Zhang, Shao-Jie Shen et al.
· 0 citations