Skip to main content
QUICK REVIEW

[论文解读] A Brief Review of Domain Adaptation

Abolfazl Farahani, Sahar Voghoei|arXiv (Cornell University)|Oct 7, 2020
Domain Adaptation and Few-Shot Learning被引用 11
一句话总结

本文对机器学习中的无监督域自适应(UDA)进行了全面综述,重点介绍在无目标域标签的情况下对齐源域与目标域分布的技术。文章综述了浅层与深层方法,包括对抗性域自适应、域混淆和基于GAN的方法,表明学习域不变表征能显著提升模型在分布偏移下的泛化能力。

ABSTRACT

Classical machine learning assumes that the training and test sets come from the same distributions. Therefore, a model learned from the labeled training data is expected to perform well on the test data. However, This assumption may not always hold in real-world applications where the training and the test data fall from different distributions, due to many factors, e.g., collecting the training and test sets from different sources, or having an out-dated training set due to the change of data over time. In this case, there would be a discrepancy across domain distributions, and naively applying the trained model on the new dataset may cause degradation in the performance. Domain adaptation is a sub-field within machine learning that aims to cope with these types of problems by aligning the disparity between domains such that the trained model can be generalized into the domain of interest. This paper focuses on unsupervised domain adaptation, where the labels are only available in the source domain. It addresses the categorization of domain adaptation from different viewpoints. Besides, It presents some successful shallow and deep domain adaptation approaches that aim to deal with domain adaptation problems.

研究动机与目标

  • 解决当测试数据来自与训练数据不同的分布时,机器学习模型性能下降的挑战。
  • 综述无监督域自适应技术,以实现在有标签的源域与无标签的目标域之间进行知识迁移。
  • 从多个视角对域自适应进行分类,包括分布对齐、任务不变性以及表征学习。
  • 介绍并分析基于深度学习的关键UDA方法,如域混淆、MADA和CyCADA,以实现联合分布对齐。
  • 强调最小化边缘分布与类别条件分布偏移的重要性,以实现稳健的迁移学习。

提出的方法

  • 通过对抗性训练学习域不变特征,方法是利用试图区分源域与目标域的域判别器,最小化域分类器损失。
  • 采用极小化极大优化方法,以最大化域混淆的方式训练生成器与判别器,迫使特征提取器生成在域之间无法区分的表征。
  • 引入软标签损失,以在源域与目标域之间传递更丰富的类别关系(如语义相似性),从而在硬标签之外提升泛化能力。
  • 在MADA中应用多类别域判别器,以对齐类别条件分布,减少因类别分布不匹配导致的负迁移。
  • 通过循环一致性对抗域自适应(CyCADA)结合像素级与特征级自适应,强制执行循环一致性,以保留内容与风格。
  • 在PixelDA与SimGAN中使用生成对抗网络(GAN),在像素级别将源图像翻译为目标域风格,同时保留语义内容。

实验结果

研究问题

  • RQ1当目标域无任何标注数据时,如何有效缓解源域与目标域之间的域偏移?
  • RQ2联合分布对齐(尤其是类别条件分布的对齐)在提升深度特征可迁移性方面起到何种作用?
  • RQ3与仅进行边缘分布对齐相比,对抗性域自适应方法(如域混淆与MADA)在多大程度上减少了负迁移?
  • RQ4在像素级与特征级的基于GAN的方法中,如何在适应目标域分布的同时保留语义内容?
  • RQ5循环一致性学习是否能通过在域之间强制双向一致性来改善域自适应?

主要发现

  • 通过域混淆的对抗性域自适应能有效减少域偏移,通过学习使域判别器混淆的表征,从而提升泛化能力。
  • MADA通过实现类别条件分布的细粒度对齐,优于单域判别器方法,减少了负迁移。
  • 软标签损失通过不仅传递硬标签,还传递类别之间的语义关系(如书架与文件柜之间的相似性),从而提升性能。
  • CyCADA通过结合像素级与特征级自适应及循环一致性,实现了最先进性能,在保留内容的同时对齐域分布。
  • 像素级方法如PixelDA与SimGAN成功将源图像翻译为匹配目标域风格,从而在视觉域自适应任务中提升性能。
  • 理论分析表明,域不变表征不应对源域或目标域具有判别性信息,这为对抗训练中使用域混淆提供了理论依据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。