[论文解读] Zero-Shot and Few-Shot Learning for Lung Cancer Multi-Label Classification using Vision Transformer
本研究提出一种基于视觉Transformer(ViT)的方法,利用LC25000数据集对肺腺癌(LUAD)、肺鳞状细胞癌(LUSC)和良性组织的组织病理学切片进行零样本和少样本多标签分类。微调5个训练周期后,预训练ViT在少样本学习中实现了99.87%的准确率,并在验证集和测试集上均达到100%的准确率,表明其在极少标注数据下仍具备出色的泛化能力。
Lung cancer is the leading cause of cancer-related death worldwide. Lung adenocarcinoma (LUAD) and lung squamous cell carcinoma (LUSC) are the most common histologic subtypes of non-small-cell lung cancer (NSCLC). Histology is an essential tool for lung cancer diagnosis. Pathologists make classifications according to the dominant subtypes. Although morphology remains the standard for diagnosis, significant tool needs to be developed to elucidate the diagnosis. In our study, we utilize the pre-trained Vision Transformer (ViT) model to classify multiple label lung cancer on histologic slices (from dataset LC25000), in both Zero-Shot and Few-Shot settings. Then we compare the performance of Zero-Shot and Few-Shot ViT on accuracy, precision, recall, sensitivity and specificity. Our study show that the pre-trained ViT model has a good performance in Zero-Shot setting, a competitive accuracy ($99.87\%$) in Few-Shot setting ({epoch = 1}) and an optimal result ($100.00\%$ on both validation set and test set) in Few-Shot seeting ({epoch = 5}).
研究动机与目标
- 通过利用预训练视觉Transformer实现零样本和少样本学习,解决肺癌诊断中组织病理学数据标注有限的挑战。
- 评估视觉Transformer在极少或无需微调的情况下,对全切片图像中多种肺癌亚型(LUAD、LUSC、良性)分类的性能。
- 在LC25000数据集上,对比ViT在多标签分类任务中采用零样本和少样本迁移学习策略的表现。
- 利用Grad-CAM解释模型预测结果,并验证其与专家病理科医生视觉推理的一致性。
提出的方法
- 在LC25000数据集上对预训练视觉Transformer(ViT)模型进行微调,实现少样本学习,训练过程持续5个周期,并在每个周期后进行验证。
- 通过直接使用预训练ViT模型的冻结权重,不进行任何微调,实现零样本推理。
- 采用梯度加权类激活映射(Grad-CAM)生成注意力热图,突出显示组织学图像中具有判别性的区域,以增强模型可解释性。
- 将Grad-CAM可视化结果与病理科专家的标注进行对比,评估模型预测的忠实度及其与临床推理的一致性。
- 使用准确率、精确率、召回率、敏感度、特异度以及AUC-ROC指标,对所有三类(LUAD、LUSC、良性)进行模型性能评估。
- 采用自监督预训练和迁移学习策略,缓解自然图像与医学组织病理学图像之间的领域差异。
实验结果
研究问题
- RQ1预训练视觉Transformer在从组织病理学切片中进行肺癌亚型零样本分类时表现如何?
- RQ2对ViT模型进行少样本微调在多标签肺癌分类任务中带来了多大的性能提升?该性能在不同训练周期中如何变化?
- RQ3ViT模型生成的Grad-CAM可视化结果是否与病理科医生在识别癌变区域时的临床决策过程一致?
- RQ4在零样本和少样本设置下,ViT模型在LUAD、LUSC和良性三类中的AUC-ROC表现如何比较?
- RQ5ViT模型在对抗性扰动和数据集偏差下是否保持鲁棒性与可解释性?
主要发现
- 在零样本设置下,预训练视觉Transformer在验证集上的准确率为33.77%,测试集上的准确率也为33.77%,表明在未微调的情况下泛化能力有限。
- 经过一个训练周期的微调后,ViT模型在少样本设置下的验证集准确率达到98.90%,测试集准确率达到98.87%。
- 经过五个训练周期的微调后,ViT模型在验证集和测试集上的准确率均达到100.00%,表明在极小数据量下已达到最优性能。
- 在少样本设置(第5个训练周期)下,ViT模型在所有三类(LUAD、LUSC、良性)中的AUC-ROC值均为1.00000000,表明实现了完美的判别能力。
- Grad-CAM可视化结果与病理科专家标记的显著区域在空间上高度一致,验证了模型的可解释性与临床相关性。
- 模型对对抗性扰动表现出鲁棒性,并能有效揭示数据集偏差,通过忠实的注意力定位提升了模型泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。