[论文解读] f-Domain-Adversarial Learning: Theory and Algorithms
本文提出 f-Domain-Adversarial Learning (f-DAL),一种新颖的域自适应框架,基于变分 f-散度推导出泛化界,从而为原始 DANN 算法提供理论基础支持的修正。该方法在无需额外正则化项或超参数的情况下实现最先进性能,尤其在真实世界视觉与自然语言处理基准上使用皮尔逊 χ² 散度时表现尤为出色。
Unsupervised domain adaptation is used in many machine learning applications where, during training, a model has access to unlabeled data in the target domain, and a related labeled dataset. In this paper, we introduce a novel and general domain-adversarial framework. Specifically, we derive a novel generalization bound for domain adaptation that exploits a new measure of discrepancy between distributions based on a variational characterization of f-divergences. It recovers the theoretical results from Ben-David et al. (2010a) as a special case and supports divergences used in practice. Based on this bound, we derive a new algorithmic framework that introduces a key correction in the original adversarial training method of Ganin et al. (2016). We show that many regularizers and ad-hoc objectives introduced over the last years in this framework are then not required to achieve performance comparable to (if not better than) state-of-the-art domain-adversarial methods. Experimental analysis conducted on real-world natural language and computer vision datasets show that our framework outperforms existing baselines, and obtains the best results for f-divergences that were not considered previously in domain-adversarial learning.
研究动机与目标
- 通过基于 f-散度的泛化界推导,弥合域自适应理论与实际对抗训练方法之间的差距。
- 识别并修正 Ganin 等人(2016)原始域对抗训练(DANN)方法中的根本性缺陷,该缺陷未与预期的散度最小化目标对齐。
- 证明当训练过程被正确修正时,现有域对抗方法中许多人为设计的正则化项与目标函数是不必要的。
- 评估多种 f-散度(包括 JS、皮尔逊 χ² 等)在最小化域差异与提升迁移学习性能方面的表现。
- 展示 f-DAL 搭配皮尔逊 χ² 散度的性能优于最先进方法,且无需额外技术或超参数调优。
提出的方法
- 利用 f-散度的变分表征,为无监督域自适应推导出新的泛化界,该界推广了 $χ\Delta\u03c7$-散度,并将总变差与 JS-散度作为特例包含在内。
- 将 DANN 中的域判别器重新解释为最小化 f-散度,明确指出原始方法实际上最小化的是 JS-散度。
- 提出一种经修正的训练目标,使域对抗训练过程真正与预期的 f-散度最小化对齐,从而修正原始 DANN 框架中的梯度更新方式。
- 提出一个通用的算法框架 f-DAL,支持广泛类型的 f-散度,包括此前未在域对抗学习中使用过的散度。
- 采用双网络架构,其中域判别器被训练以区分源域与目标域特征,损失函数基于变分 f-散度估计器推导得出。
- 在多个真实世界数据集(如 Office-31、Office-Home)上验证该框架,使用标准深度学习主干网络,比较不同 f-散度及消融设置下的性能表现。
实验结果
研究问题
- RQ1能否基于 f-散度的变分表征,推导出一个泛化界,使其涵盖现有理论结果并具有更广的适用性?
- RQ2为何许多最先进域对抗方法依赖于人为设计的正则化项与目标函数,即使它们在原始 DANN 框架中缺乏理论基础?
- RQ3正确训练域对抗网络以最小化特定 f-散度的正确方式是什么?它与原始 DANN 流程有何本质区别?
- RQ4在域对抗框架中,哪种 f-散度能带来最佳的迁移性能?是否需要额外技术或超参数调优?
- RQ5f-DAL 是否能在无需额外架构或优化修改的情况下,超越 MDD 和 CDAN 等现有方法?
主要发现
- 所提出的 f-DAL 框架在多个基准数据集(包括 Office-31 和 Office-Home)上实现了最先进性能,且无需额外正则化项或超参数调优。
- f-DAL 中的皮尔逊 χ² 散度优于以往方法,甚至在某些设置下超越 MDD,实现最佳结果且无需任何附加技术。
- 对原始 DANN 算法的修正——使梯度更新与真实 f-散度最小化对齐——解释了为何 MDD 优于 DANN,同时消除了对人为设计目标的依赖。
- 实验表明,f-DAL-JS(使用 JS 散度)的性能与 DANN 或 MDD 相当或更优,证明了修正后训练流程的有效性。
- 该框架对标签分布偏移具有鲁棒性:当与基于采样的对齐方法(如 Jiang 等人,2020)结合时,f-DAL-Pearson 在标签边缘分布存在显著差异的数据集(如 Office-Home)上表现出明显提升。
- 理论分析证实,f-DAL 推广了 Ben-David 等人(2010a)提出的 $χ\Delta\u03c7$-散度界,并支持如 JS 与皮尔逊 χ² 等实际应用中的散度,从而在理论与实践之间建立了严谨的联系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。