When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models
The results support analyzing subjective speech rewards as predictor-axis-base tuples as predictor-axis-base tuples and provide practical diagnostics for selecting rewards before multi-reward speech post-training.
Joonyong Park, Jerry Li
· 0 citations