Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
Group-relative residual calibration can incorporate verifier outcomes without discarding dense token-level guidance, and demonstrates that group-relative residual calibration can incorporate verifier outcomes without discarding dense token-level guidance.
Zhu Zhang, Jixun Wang, Xiaoan Xu et al.
· 0 citations