Preprint
Aug 2026
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation
NeuronFuzz is presented, a white-box fuzzing framework that exploits internal safety neurons as continuous execution feedback for LLM safety evaluation and achieves a 76-100% jailbreak discovery rate, outperforming baselines by up to 48 percentage points.
Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner et al.
· 0 citations