[论文解读] Scopeformer: n-CNN-ViT Hybrid Model for Intracranial Hemorrhage Classification
该论文提出了一种新型的 n-CNN-ViT 混合模型 Scopeformer,通过在 Vision Transformer 之前堆叠来自多个在不同数据集上预训练的 Xception CNN 的特征图(ImageNet 和 GAN 生成的脑部 CT 图像),从而提升颅内出血分类性能。该方法在测试集上达到 98.04% 的准确率,加权对数损失为 0.0708,相较于标准 ViT,展现出更丰富的特征表示和更高的注意力效率。
We propose a feature generator backbone composed of an ensemble of convolutional neuralnetworks (CNNs) to improve the recently emerging Vision Transformer (ViT) models. We tackled the RSNA intracranial hemorrhage classification problem, i.e., identifying various hemorrhage types from computed tomography (CT) slices. We show that by gradually stacking several feature maps extracted using multiple Xception CNNs, we can develop a feature-rich input for the ViT model. Our approach allowed the ViT model to pay attention to relevant features at multiple levels. Moreover, pretraining the n CNNs using various paradigms leads to a diverse feature set and further improves the performance of the proposed n-CNN-ViT. We achieved a test accuracy of 98.04% with a weighted logarithmic loss value of 0.0708. The proposed architecture is modular and scalable in both the number of CNNs used for feature extraction and the size of the ViT.
研究动机与目标
- 通过增强输入特征表示,提升 Vision Transformer 在颅内出血分类任务中的性能。
- 通过 GAN 增强的预训练方法,缓解自然图像(ImageNet)与医学 CT 扫描之间的领域差距。
- 探究使用多个多样化 CNN 主干网络对 ViT 注意力机制与分类准确率的影响。
- 开发一种模块化、可扩展的架构,以提升医学图像分析中的特征分辨率与多样性。
- 证明在低样本医学图像任务中,CNN 提取的特征优于直接输入原始图像的 ViT 表现。
提出的方法
- 该模型使用多个 Xception CNN 作为特征提取器,每个网络在不同数据范式上进行预训练:ImageNet 和 GAN 生成的脑部 CT 图像。
- 将每个 CNN 的特征图(7×7×1024)拼接,形成高维输入(7×7×n×1024)送入 ViT 编码器。
- 较小的变体采用 1×1 卷积将特征图通道数从 1024 减少至 128,降低计算负载,同时保持性能。
- ViT 编码器通过跨 patch 的多头自注意力机制处理拼接后的特征图,以捕捉全局上下文信息。
- 预训练策略包括在 RSNA 数据集上微调 ImageNet 预训练模型,并进一步在 GAN 合成的脑部 CT 图像上进行预训练,以增强归纳偏置。
- 该架构具有模块化特性,可灵活扩展 CNN 数量与 ViT 大小。
实验结果
研究问题
- RQ1多个多样化 CNN 主干是否能提升输入到 Vision Transformer 的特征质量,从而改善医学图像分类性能?
- RQ2在 GAN 增强的医学图像上进行预训练,是否能有效缓解自然图像预训练与颅内 CT 扫描之间的领域偏移?
- RQ3在特征提取主干中使用多少个 CNN 对 ViT 在出血分类任务中的性能有何影响?
- RQ4通过 1×1 卷积降低特征输入维度(即减少通道数)是否能在降低计算成本的同时保持高准确率?
- RQ5与直接将原始 CT 图像输入标准 ViT 相比,n-CNN-ViT 混合架构是否具有更优的分类性能?
主要发现
- 采用多样化预训练(ImageNet/GAN)的 3-CNN-ViT 模型在测试中达到最高准确率 98.04%,加权对数损失为 0.07050。
- 使用多个具有不同预训练范式的 CNN 显著提升了性能,相较于单一或相同主干网络有明显优势。
- 采用 GAN 增强预训练的 2-CNN-ViT 模型在输入维度降低至 7×7×256 的情况下,仍达到 97.58% 的准确率,展现出良好的可扩展性与效率。
- 直接将标准 ViT 应用于原始图像的模型仅达到 94.33% 的准确率,证实了基于 CNN 的特征增强具有显著优势。
- 随着 CNN 数量的增加,性能呈单调上升趋势,表明特征多样性能够增强 ViT 的注意力机制与分类能力。
- 模块化设计支持灵活扩展 CNN 数量与 ViT 大小,适用于不同硬件约束下的高效部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。