Meta-SecAlign: Training LLMs against Prompt Injection for Robust Agents
Meta-SecAlign is proposed for utility-preserving defense by (1) randomized injection position during training to avoid shortcut learning and (2) self-generated responses as high-quality in-distribution training labels as high-quality in-distribution training labels.
Si-Zhe Chen, A. Zharmagambetov, David A. Wagner et al.
· 0 citations