Jul 2026
Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization
An exploratory study involving over 30,000 real-world agent interaction records and 45 stand-up comedians reveals practical safety concerns in LLM-based content humorization, and proposes a prompt injection attack that exploits latent risks in humor-based defenses.
Yu Cui, Ruiqing Yue, Tingyu Li et al.
· arXiv.org · 0 citations