XAIViT: An Explainable Vision Transformer Framework for Multi-Class Brain Tumor Classification in MRI Images
Brain tumors require accurate and early diagnosis to support effective treatment decisions. Magnetic Resonance Imaging (MRI) is widely used for brain tumor assessment; however, many deep learning-based approaches remain black-box systems with limited clinical interpretability. This study proposes Explainable Artificial Intelligence Vision Transformer (XAIViT), a hybrid Convolutional Neural Network (CNN)–Transformer architecture designed to improve both classification performance and model interpretability for four-class brain tumor classification. The proposed framework integrates EfficientNet-B3 as a convolutional feature extractor with a Transformer Encoder to capture global contextual information through self-attention mechanisms. Experiments were conducted using the Brain Tumor MRI Dataset from Kaggle, which consists of 7023 MRI images across four classes: glioma, meningioma, pituitary, and no-tumor. Data preprocessing included intensity normalization, data augmentation, stratified dataset splitting, and early stopping strategies during training. The proposed XAIViT framework achieved a classification accuracy of 99.24%, with macro-average precision, recall, and F1-score values exceeding 0.99 on the test dataset. Furthermore, Gradient-weighted Class Activation Mapping (Grad-CAM)-based visual explanations demonstrated that the model consistently focused on anatomically relevant tumor regions, thereby improving transparency and trustworthiness. These findings indicate that the proposed XAIViT framework has strong potential as an Explainable Artificial Intelligence (XAI)-based clinical decision support system for MRI-based brain tumor analysis.