SFT Augmentation and Replay-Based RL for Countdown Reasoning
This work studies how supervised fine-tuning data quality and reinforcement learning (RL) optimization design affect performance on Countdown arithmetic reasoning under a reinforcement learning with verifiable rewards (RLVR) setup, and investigates whether replay-based reinforcement learning can improve sample efficiency during RL fine-tuning.