Skip to main content
QUICK REVIEW

[论文解读] A Strong Baseline for Domain Adaptation and Generalization in Medical Imaging

Yao Li, Jordan Prosky|arXiv (Cornell University)|Apr 2, 2019
COVID-19 diagnosis using AI被引用 9
一句话总结

本文通过在多样化、多源的胸部X光图像数据集上训练深度学习模型,提出了一种简单但有效的医学影像领域自适应与泛化基线。使用在十个全球数据集汇总数据上微调的DenseNet-121,该方法在域外测试集上实现了稳定的性能提升,表明多领域训练能显著提高泛化能力并减少领域过拟合。

ABSTRACT

This work provides a strong baseline for the problem of multi-source multi-target domain adaptation and generalization in medical imaging. Using a diverse collection of ten chest X-ray datasets, we empirically demonstrate the benefits of training medical imaging deep learning models on varied patient populations for generalization to out-of-sample domains.

研究动机与目标

  • 解决医学影像中关键的领域过拟合问题,即在单一机构数据上训练的模型在域外数据上表现不佳。
  • 探究在多个多样化患者群体上进行训练是否能提升模型在不同临床环境和地理区域中的泛化能力。
  • 建立一个实用且直观的医学影像领域泛化基线,其性能优于单领域训练。
  • 展示数据多样性在减轻模型在不同医疗机构部署时性能下降方面的实证优势。

提出的方法

  • 在来自全球多样化来源的五个公开和一个私有胸部X光数据集的合并数据集上,对在ImageNet上预训练的DenseNet-121模型进行训练。
  • 在所有数据集中采用标准的80/20患者划分进行训练和测试,不使用领域特定的数据增强或归一化。
  • 通过AUC(曲线下面积)评估模型在十个不同测试领域(包括不同国家的公开和私有数据集)上的性能。
  • 开展留一域排除实验,以评估每个源领域对整体泛化性能的贡献。
  • 比较在单一领域与在所有领域联合训练的模型性能,以量化数据多样性带来的收益。
  • 使用标准交叉熵损失和标准优化方法(如Adam),不引入领域特定正则化或对抗训练。

实验结果

研究问题

  • RQ1与单领域训练相比,在多个多样化医学影像数据集上进行训练是否能提升模型在域外测试集上的泛化能力?
  • RQ2排除某一特定源领域后,对在训练期间未见的目标领域性能有何影响?
  • RQ3在患者群体、临床环境和地理区域上的数据多样性在多大程度上能减少胸部X光分类中的领域过拟合?
  • RQ4在多源数据上采用简单、非对抗性、非增强的训练策略,能否作为医学影像领域泛化的一个强基线?

主要发现

  • 在所有五个源领域上同时训练的模型在PAD测试集上AUC达到0.850,优于在单一源上训练的模型(例如,在NIH上训练的模型AUC为0.811,而联合训练为0.853)。
  • 在所有五个领域上联合训练的模型在CHN 1上的AUC达到0.835,显著优于最佳单源模型(0.781),表明其对未见过的中国数据集具有强大的泛化能力。
  • 留一域排除实验表明,排除AUS、PAD或MIM会导致性能中等程度下降(例如,当排除AUS时,OPI上的AUC从0.786降至0.758),表明这些领域对泛化有独特贡献。
  • 在单一领域上训练的模型表现出高域内性能(例如,在CHX上训练时AUC为0.866),但域外性能差(例如,在NIH上AUC为0.732),凸显了领域过拟合问题。
  • 多源模型在所有五个域外测试集上的AUC均稳定高于0.78,最高达0.862(在CHX上),表明其对领域偏移具有鲁棒性。
  • 即使仅在一个源上训练,模型也能获得较高的域内AUC(例如,在CHX上为0.866),但在其他领域上性能显著下降(例如,在NIH上为0.732),强调了多领域训练的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。