Matched-Input Estimates Differ in Sign Across Architectures: Auditing EEG Foundation Models on Motor Imagery
Sign differences suggest that a single comparator may not provide an architecture-invariant decomposition of a pretrained-versus-supervised performance gap, and validation-fitted temperature scaling returns foundation-model calibration error to the supervised range despite substantially lower four-class accuracy.