Preprint
Aug 2026
DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
This work proposes Step-Aware Annealing (SAA), a plug-and-play reward sharpening mechanism that progressively increases reward curvature during training, amplifying subtle quality differences among high-scoring samples while preserving stability in early learning.
Yunhao Wang, Bing-Hong Wu, Zhenyu Huang et al.
· 0 citations