[论文解读] A Novel Vision Transformer with Residual in Self-attention for Biomedical Image Classification
本文提出了一种新型视觉Transformer(ViT)架构,在多头自注意力机制中引入残差连接,其中通过注意力分数的L1范数选择最佳注意力头,并将其作为残差连接添加到最终输出。该方法在生物医学图像分类中提升了特征表示能力,在血细胞图像上达到93.38%的准确率,在脑部MRI肿瘤检测上达到96.15%,优于标准ViT和卷积神经网络SOTA模型。
Biomedical image classification requires capturing of bio-informatics based on specific feature distribution. In most of such applications, there are mainly challenges due to limited availability of samples for diseased cases and imbalanced nature of dataset. This article presents the novel framework of multi-head self-attention for vision transformer (ViT) which makes capable of capturing the specific image features for classification and analysis. The proposed method uses the concept of residual connection for accumulating the best attention output in each block of multi-head attention. The proposed framework has been evaluated on two small datasets: (i) blood cell classification dataset and (ii) brain tumor detection using brain MRI images. The results show the significant improvement over traditional ViT and other convolution based state-of-the-art classification models.
研究动机与目标
- 解决深度学习中生物医学图像数据集有限且不平衡的挑战。
- 提升视觉Transformer在医学图像分类中的特征表示与泛化能力。
- 提出一种基于注意力分数L1范数的多头自注意力残差机制,选择最具信息量的注意力头。
- 在小样本生物医学数据集上增强模型鲁棒性并减少过拟合。
- 在两个生物医学图像分类基准上,证明所提方法优于标准ViT和最先进的基于CNN的模型。
提出的方法
- 所提方法计算每个多头自注意力头的注意力分数的L1范数(曼哈顿范数)。
- 选择L1范数最高的注意力头作为“最佳”头,代表最具信息量的注意力模式。
- 将该最佳头的输出在经过线性投影层后,作为残差连接添加到最终的投影注意力输出中。
- 该残差连接将最具判别性的注意力特征整合到最终表征中,从而增强特征学习。
- 将修改后的注意力模块集成到预训练的ViT-base模型中,并在生物医学数据集上进行微调。
- 该方法保持计算效率,由于仅涉及低开销的排序和范数运算,其复杂度与标准ViT几乎相同。
实验结果
研究问题
- RQ1通过注意力分数的L1范数选择最具信息量的注意力头,能否提升ViT在小样本生物医学数据集上的性能?
- RQ2将最佳注意力头作为残差连接集成,能否增强特征表示与分类准确率?
- RQ3在类别不平衡的生物医学图像数据上,所提ViT变体与标准ViT及最先进的CNN模型相比,在准确率与泛化能力方面表现如何?
- RQ4该残差机制是否能减少过拟合并提升在有限训练数据上的泛化能力?
- RQ5该注意力机制能否有效应用于多种生物医学图像任务,如血细胞分类与脑肿瘤检测?
主要发现
- 所提ViT在血细胞分类数据集上达到93.38%的准确率,显著优于次优模型(ViT为88.38%)。
- 在脑部MRI肿瘤检测数据集上,所提方法达到96.15%的准确率,超越标准ViT(92.15%)和ResNet18(92.16%)。
- 血细胞数据集的F1-score达到0.94,表明精确率与召回率之间平衡良好,优于标准ViT的0.89。
- 模型的训练与验证准确率曲线差距减小,表明泛化能力更强,过拟合更少。
- 混淆矩阵显示,与预训练ViT基线相比,所提模型在两个数据集上的误分类更少。
- 复杂度分析表明,该方法仅增加极少的计算开销,保持与标准ViT相同的O(n²d)复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。