Preprint
Aug 2026
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
Specialize-and-Merge Online Policy Distillation (SMOPD) is proposed, a two-stage training method for multi-reward optimization that outperforms GDPO across 1.5B, 3B and 7B backbones.
Wen Wang, Jiahua Bao, Tu Yongsiqi et al.
· 1 citation