Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents
Self-evolving large language model agents improve their capabilities by distilling interaction trajectories into persistent experiences. Yet this mechanism introduces a new safety risk: experiences that are benign in isolation may jointly weaken an agent's safety boundary when accumulated and reused across sessions. Ex...