Preprint
Aug 2026
Inadvertent Context Leakage in Language Models
Leakage enables two practical attacks: a trained classifier that infers semantic predicates about user memories from routine natural-language outputs, and an RL-trained adversary that extracts full Social Security Numbers from a production-style agent.
Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri et al.
· 0 citations