Debiased visual question answering via spatial-frequency invariant semantic learning
A novel spatial-frequency invariant semantic learning model designed to overcome limitations in visual question answering models by incorporating frequency-domain features as an additional modality and employing invariant feature learning techniques, effectively reduces bias without relying on external datasets.