Jul 2026
Evaluating LLM Robustness Under Domain-Specific Prompt Perturbations in Public Health Applications
A domain specific robustness benchmark is proposed that evaluates LLMs under two perturbation types that commonly arise when non-clinical users interact with health AI systems: misinformation framing (MF) and layperson rewriting (LR).
Chuqing Zhao, Haochen Yang
· arXiv.org · 0 citations