CodeMimicry: Exploiting Safety Generalization Lag in Large Language Models via Structured Code Completion
Large language models have achieved remarkable capabilities across diverse domains, yet their safety alignment remains vulnerable to jailbreak attacks. In this work, we identify a previously underexplored failure mode - safety generalization lag - where alignment trained predominantly on natural language fails to trans...