Skip to main content
QUICK REVIEW

[论文解读] Knowledge distillation for semi-supervised domain adaptation

Mauricio Orbes‐Arteaga, M. Jorge Cardoso|arXiv (Cornell University)|Aug 16, 2019
Domain Adaptation and Few-Shot Learning参考文献 11被引用 5
一句话总结

本文提出了一种基于知识蒸馏(KD)的半监督域自适应方法,用于医学图像分割,特别针对MRI扫描中的白质高信号(WMH)。与需要大量超参数调优的对抗性域自适应(ADA)不同,KD通过利用未标注目标域数据的软标签,将知识从教师网络传递到学生网络,在无需目标域标注数据的情况下,显著提升了在不同扫描仪和人群域中的Dice分数。

ABSTRACT

In the absence of sufficient data variation (e.g., scanner and protocol variability) in annotated data, deep neural networks (DNNs) tend to overfit during training. As a result, their performance is significantly lower on data from unseen sources compared to the performance on data from the same source as the training data. Semi-supervised domain adaptation methods can alleviate this problem by tuning networks to new target domains without the need for annotated data from these domains. Adversarial domain adaptation (ADA) methods are a popular choice that aim to train networks in such a way that the features generated are domain agnostic. However, these methods require careful dataset-specific selection of hyperparameters such as the complexity of the discriminator in order to achieve a reasonable performance. We propose to use knowledge distillation (KD) -- an efficient way of transferring knowledge between different DNNs -- for semi-supervised domain adaption of DNNs. It does not require dataset-specific hyperparameter tuning, making it generally applicable. The proposed method is compared to ADA for segmentation of white matter hyperintensities (WMH) in magnetic resonance imaging (MRI) scans generated by scanners that are not a part of the training set. Compared with both the baseline DNN (trained on source domain only and without any adaption to target domain) and with using ADA for semi-supervised domain adaptation, the proposed method achieves significantly higher WMH dice scores.

研究动机与目标

  • 解决因扫描仪和人群差异导致的医学图像分割中的域偏移问题,尤其是在标注数据有限的情况下。
  • 开发一种在未见域中具有良好泛化能力的域自适应方法,且无需目标域的标注数据。
  • 减少对数据集特定超参数调优的依赖,这是对抗性域自适应(ADA)的主要局限。
  • 评估知识蒸馏作为半监督域自适应中对抗性方法的更简单、更鲁棒的替代方案。
  • 在跨扫描仪和跨人群场景下,展示对白质高信号(WMH)分割性能的改进。

提出的方法

  • 在源域数据(如乌得勒支MRI扫描)上预训练一个教师网络,并利用其对未标注的目标域图像生成软概率分布(logits)。
  • 使用一种通过温度缩放的交叉熵损失的KD损失,训练学生网络以模仿教师在目标域图像上的输出。
  • KD损失促使学生网络从教师的软标签中学习类间相似性模式,即使在目标域没有真实标注的情况下也能实现。
  • 该方法在“即时适应”和经典域自适应设置中均被应用,利用少量未标注的目标域数据引导适应过程。
  • 通过结合源域的监督损失和教师在目标域数据上的KD损失,对学生网络进行端到端微调。
  • 温度超参数仅在源域上进行调优,从而最小化对目标域特定调优的需求。

实验结果

研究问题

  • RQ1在医学图像分割的半监督设置中,知识蒸馏是否能比对抗性域自适应(ADA)实现更好的域自适应性能?
  • RQ2与ADA相比,知识蒸馏在不同MRI扫描仪和人群群体中的泛化能力是否更优?
  • RQ3KD是否对超参数调优的敏感性低于ADA,特别是对判别器复杂度的敏感性?
  • RQ4与ADA相比,KD在小病灶或深部白质区域的病灶分割中表现如何?
  • RQ5KD能否与对抗性方法结合,以进一步提升跨域泛化性能?

主要发现

  • 在所有测试的域自适应场景中,知识蒸馏的平均Dice分数显著高于基线深度神经网络(DNN)和ADA,配对样本t检验的p值均小于0.05。
  • 在即时适应场景中,KD在6个测试案例中的5个中优于ADA,其中4个具有统计学显著性提升。
  • 在具有挑战性的乌得勒支到新加坡的域适应任务中,ADA略胜于KD,但KD在反向适应(新加坡到乌得勒支)中表现更优,表明域偏移存在不对称性。
  • KD在深部白质区域的小病灶中表现出更好的泛化能力,而ADA在此类区域表现较差,这一结果在分割对比图中得到视觉验证。
  • 该方法在不同目标域中表现出一致的性能,适应即时与经典设置下的Dice分数保持稳定,表明其鲁棒性高且对少量目标数据依赖低。
  • 当教师模型替换为经ADA适应后的模型时,KD的平均Dice分数从0.65提升至0.69,表明KD能从更鲁棒的教师网络中获益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。