CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning
This work proposes CVPO - Curriculum-guided Value-Variance Policy Optimization, a dynamic curriculum weighting method that adapts to question difficulty that achieves better performance and stronger exploration, enabling more accurate and robust reasoning in language models across various math tasks.