One Turn Too Late: Learning When to Intervene Against Multi-Turn Malicious Intent
Experiments show that turn-level boundary supervision improves intervention localization, while reinforcement learning further improves the safety--utility trade-off.
Xin-Jie Shen, Rong-Zhe Wei, Pei-Zhi Niu et al.
· 0 citations