'Ghaib in Translation'aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with'Missed-in-Urdu'Scores in LLM Hate Speech Detection
Results indicate that current LLMs provide uneven safety assurance across Urdu's script varieties, with smaller open-weight models showing substantially higher instability and missed-harm rates than frontier closed models.
F. Kara-Isitt, Sonal Khosla, Stephen Swift
· 0 citations