Jul 2026
Contrastive Reinforced Policy Optimization via Privileged Self-Distillation
Contrastive Reinforced Policy Optimization (CRPO) is introduced, which reformulates agentic OPSD from a contrastive learning perspective, and conducts group-wise contrast to preserve reliable, fine-grained optimization signals.
Xingjian Wu, Junlin Liu, Xing-Chen Liu et al.
· arXiv.org · 1 citation