Skip to main content
QUICK REVIEW

[论文解读] On Target Shift in Adversarial Domain Adaptation

Yitong Li, Michael Murias|PubMed|Mar 15, 2019
Domain Adaptation and Few-Shot Learning参考文献 1被引用 7
一句话总结

该论文提出DATS,一种领域对抗网络,通过分布匹配估计目标域标签比例,并根据源域与目标域的相似性加权源域,以解决无监督多源域自适应中的标签偏移问题。该方法在大标签偏移下提升了泛化性能,在合成数据集和真实世界EEG/LFP数据集上均显著优于DANN和MDANs。

ABSTRACT

Discrepancy between training and testing domains is a fundamental problem in the generalization of machine learning techniques. Recently, several approaches have been proposed to learn domain invariant feature representations through adversarial deep learning. However, label shift, where the percentage of data in each class is different between domains, has received less attention. Label shift naturally arises in many contexts, especially in behavioral studies where the behaviors are freely chosen. In this work, we propose a method called Domain Adversarial nets for Target Shift (DATS) to address label shift while learning a domain invariant representation. This is accomplished by using distribution matching to estimate label proportions in a blind test set. We extend this framework to handle multiple domains by developing a scheme to upweight source domains most similar to the target domain. Empirical results show that this framework performs well under large label shift in synthetic and real experiments, demonstrating the practical importance.

研究动机与目标

  • 为解决目标域偏移问题——即源域与目标域的类别标签比例不同,该问题在对抗领域自适应中常被忽视。
  • 开发一种方法,在盲测试设置下利用分布匹配估计未知的目标域标签比例。
  • 通过基于与目标域相似性的源域加权,改进多源领域自适应,避免无关源域带来的性能下降。
  • 将标签比例估计与领域加权整合进一个统一的、端到端可训练的对抗领域自适应框架中。
  • 在合成数据集和真实世界生物医学数据集(如EEG和LFP记录)中,验证该方法在大标签偏移下的鲁棒性能。

提出的方法

  • 该方法使用共享特征提取器学习领域不变表示,并通过对抗训练方式训练领域判别器,以促进领域混淆。
  • 引入标签比例估计器,以最小化在考虑估计标签比例后,源域与目标域特征之间的边缘分布差距。
  • 通过均值匹配和分布匹配估计目标域中的标签比例,使用一个损失项将预测标签分布与估计标签分布对齐。
  • 引入可学习的加权向量,根据特征层面的相似性为与目标域最相似的源域分配更高重要性,以抑制无关域的影响。
  • 以迭代方式端到端联合优化特征提取、领域不变性、标签预测和标签比例估计。
  • 通过引入领域相关性加权方案,将框架扩展至多源设置,实现对最相关信息源域的动态选择。

实验结果

研究问题

  • RQ1当目标域的类别分布与源域显著不同时,标签比例估计是否能提升领域自适应性能?
  • RQ2如何根据源域与目标域的相关性对源域进行加权,以提升多源领域自适应中的泛化能力?
  • RQ3标签比例的分布匹配是否优于简单的均值匹配,在估计目标域类别分布方面表现更优?
  • RQ4统一框架能否同时估计标签比例并加权源域,以减轻无关或噪声源数据的负面影响?
  • RQ5在真实世界生物医学数据集中,当小样本且类别不平衡时,该方法在大目标域偏移下的表现如何?

主要发现

  • 在目标域偏移下的所有数字图像分类任务中,DATS均优于DANN和MDANs,在ASD EEG数据集上达到67.2%的准确率,显著高于DANN的63.8%。
  • 在LFP数据集上,DATS达到77.2%的准确率,优于DANN(75.1%)和MDANs(71.4%),证明其在大标签偏移下的鲁棒性。
  • 仅使用均值匹配策略已优于基线模型,而分布匹配进一步带来微小但一致的性能增益。
  • 即使源域数量增加至21个(ASD)和28个(LFP),模型仍保持高性能,避免了多源设置中常见的过拟合问题。
  • 该方法在极少超参数调优下表现优异,显示出在标签比例多变的真实世界应用中具有强大的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。