Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
The empirical study of multi-agent AI control is initiated, formalising distributed attacks in which several agents jointly aim for a malicious goal and evaluating single agent monitoring against distributed attacks, varying the number of agents, their coordination, model capabilities and precise monitoring configuration.