Skip to main content
QUICK REVIEW

[论文解读] On Learning Domain-Invariant Representations for Transfer Learning with Multiple Sources

Trung Phung, Trung Le|arXiv (Cornell University)|Nov 27, 2021
Domain Adaptation and Few-Shot Learning被引用 5
一句话总结

本文提出了一套理论框架,用于多源域自适应(MSDA)和域泛化(DG)设置下的域不变(DI)表示学习。该框架引入了两类DI表示——通用型与压缩型——基于对目标泛化损失的新上界推导,并建立了二者之间的权衡关系:过度压缩会损害性能,而适度压缩可提升鲁棒性。通过在Colored MNIST和PACS数据集上的实验验证了该理论,结果显示在中等压缩水平下性能达到最优。

ABSTRACT

Domain adaptation (DA) benefits from the rigorous theoretical works that study its insightful characteristics and various aspects, e.g., learning domain-invariant representations and its trade-off. However, it seems not the case for the multiple source DA and domain generalization (DG) settings which are remarkably more complicated and sophisticated due to the involvement of multiple source domains and potential unavailability of target domain during training. In this paper, we develop novel upper-bounds for the target general loss which appeal to us to define two kinds of domain-invariant representations. We further study the pros and cons as well as the trade-offs of enforcing learning each domain-invariant representation. Finally, we conduct experiments to inspect the trade-off of these representations for offering practical hints regarding how to use them in practice and explore other interesting properties of our developed theory.

研究动机与目标

  • 为多源域自适应(MSDA)与域泛化(DG)设置下域不变(DI)表示缺乏严谨的理论理解提供解决方案。
  • 推导MSDA与DG设置下目标泛化损失的上界,以实现对DI表示的正式表征。
  • 分析学习通用DI表示与压缩DI表示在性能与不变性方面的权衡关系。
  • 为在现实世界迁移学习场景中有效利用这些表示提供实用指导。
  • 通过在合成数据(Colored MNIST)与真实世界数据(PACS)上的实证评估验证理论发现。

提出的方法

  • 推导MSDA与DG设置下目标泛化损失的两个新颖上界,将其与域不变表示学习相联系。
  • 定义两类DI表示:通用DI表示(最小化源域与目标域之间的差异)与压缩DI表示(通过降维最小化差异)。
  • 利用推导出的上界分析两类表示之间的权衡,特别是压缩对目标损失下界的影响。
  • 通过使用域判别器的对抗训练,实施源-源与源-目标压缩,以在特征空间中强制实现不变性。
  • 采用统一的训练目标,结合分类损失、域对抗损失与压缩正则化,以优化两类表示。
  • 通过在Colored MNIST(MSDA)与PACS(DG)上的实验验证理论结论,调整压缩强度并测量目标准确率。

实验结果

研究问题

  • RQ1在多源域自适应与域泛化设置下,域不变表示的理论合理定义是什么?
  • RQ2通用DI表示与压缩DI表示在归纳偏置与优化目标上存在哪些差异?
  • RQ3在目标泛化性能方面,学习通用DI表示与压缩DI表示之间的权衡关系如何?
  • RQ4理论上的权衡边界能否预测最大化目标准确率的最优压缩水平?
  • RQ5在不同域偏移严重程度下(如接近域与远距离域),这些表示的行为如何?

主要发现

  • 理论分析表明,通用DI表示通过最小化源域与目标域之间的差异实现,而压缩DI表示通过降维最小化差异,导致不同的归纳偏置。
  • 存在一种权衡关系:过度压缩会提高目标损失的下界,从而可能降低性能,尤其在远距离域设置下更为明显。
  • 在Colored MNIST上,适度压缩可提升目标准确率,性能在中等压缩水平达到峰值后下降,证实了理论上的权衡关系。
  • 在PACS数据集中,艺术绘画(Art Painting)与素描(Sketch)两个目标域均表现出类似的U型准确率曲线,表明存在性能的最优压缩区间。
  • 对于接近的目标域(如艺术绘画),压缩的负面影响被缓解,表明在域偏移较小时,压缩DI表示能更准确地逼近真实标注函数。
  • 采用通用DI表示的模型在训练后期出现过拟合,性能下降;而压缩DI表示则保持了更好的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。