Small Language Models as Judges for Rubric-Based Reinforcement Learning
This work studies whether smaller language models can serve as efficient and reliable rubric-based judges, and compares three ways of extracting criterion-level judgments from small models: Generative verdicts, Yes/No Logprob margins, and Probe judges.
Feng-Yu Xie, Yilun Zhao, Bingsen Chen et al.
· 0 citations