Temperature Scaling Is Not Enough: Calibration Gaps Under Human Label Distributions
positive soft-label gaps in all nine configurations, and larger gaps in language than in vision, suggest that calibration protocols built on majority-vote labels systematically misstate model reliability wherever label ambiguity is structural, with direct consequences for deployment in safety-critical settings.