Skip to main content
QUICK REVIEW

[论文解读] Improving Unsupervised Domain Adaptation with Variational Information Bottleneck

Yuxuan Song, Lantao Yu|arXiv (Cornell University)|Nov 21, 2019
Domain Adaptation and Few-Shot Learning参考文献 34被引用 9
一句话总结

该论文提出了一种新型无监督域自适应方法——变分瓶颈域自适应(VBDA),通过引入变分信息瓶颈正则化,强制特征提取器丢弃与任务无关的因素,从而提升特征的可迁移性。通过联合最小化条件熵并施加信息瓶颈约束,VBDA在多个基准测试中达到最先进性能,在SVHN→MNIST任务上超越先前方法最高达3.3%,在Office-Home数据集上提升0.41%。

ABSTRACT

Domain adaptation aims to leverage the supervision signal of source domain to obtain an accurate model for target domain, where the labels are not available. To leverage and adapt the label information from source domain, most existing methods employ a feature extracting function and match the marginal distributions of source and target domains in a shared feature space. In this paper, from the perspective of information theory, we show that representation matching is actually an insufficient constraint on the feature space for obtaining a model with good generalization performance in target domain. We then propose variational bottleneck domain adaptation (VBDA), a new domain adaptation method which improves feature transferability by explicitly enforcing the feature extractor to ignore the task-irrelevant factors and focus on the information that is essential to the task of interest for both source and target domains. Extensive experimental results demonstrate that VBDA significantly outperforms state-of-the-art methods across three domain adaptation benchmark datasets.

研究动机与目标

  • 解决现有域自适应方法仅依赖匹配边缘特征分布的局限性,此类方法可能导致因域不变但与任务无关的因素而引发负迁移。
  • 通过信息瓶颈原理显式去除学习表征中的无关信息,提升模型在目标域的泛化能力。
  • 通过学习更清晰、语义对齐的表征,使如聚类假设等强假设更具现实可行性。
  • 提供一个理论基础坚实的正则化机制,在特征空间中平衡信息保留与干扰因素抑制。

提出的方法

  • 引入变分信息瓶颈(VIB)正则化项,约束输入与表征之间的互信息,促使模型仅保留与任务相关的信息。
  • 将条件熵最小化与VIB相结合,在潜在空间中联合优化标签一致性与表征纯净度。
  • 使用变分后验近似估计互信息上界,实现通过反向传播的端到端训练。
  • 为源域($\lambda_s$)和目标域($\lambda_t$)分别应用瓶颈正则化项,独立控制信息流。
  • 采用两阶段训练目标:域判别器用于学习域不变特征,分类头用于预测,两者均通过VIB和条件熵正则化。
  • 利用信息瓶颈原理,确保学习到的表征$Z$仅包含用于预测标签$Y$的充分统计量,从而最小化无关因素的影响。

实验结果

研究问题

  • RQ1在仅匹配边缘分布之外,强制施加信息瓶颈正则化是否能进一步提升无监督域自适应中的泛化性能?
  • RQ2通过$\lambda_s$和$\lambda_t$分别对源域和目标域进行正则化,是否能带来更优的表征学习并减少负迁移?
  • RQ3在如Office-Home这类具有大域差距的挑战性基准上,所提方法在多大程度上提升了性能?
  • RQ4联合使用条件熵与信息瓶颈对训练稳定性与收敛性有何影响?
  • RQ5信息瓶颈机制是否能使如聚类假设等强假设在实践中更有效?

主要发现

  • 在具有挑战性的SVHN→MNIST域自适应任务中,VBDA相较于先前最先进方法CyCADA实现了3.3%的准确率提升。
  • 在Office-Home基准上,VBDA平均比CDAN高出0.41%,表明其在具有大域差距和高类别多样性的数据集上表现强劲。
  • 消融研究显示,同时使用条件熵与信息瓶颈项可实现稳定训练与最优性能;而单独使用任一项则导致训练不稳定或性能下降。
  • t-SNE可视化结果表明,与DANN和MADA相比,VBDA在特征空间中学习到的类别簇更紧凑、更易分离,表明其语义对齐性更优。
  • 训练过程中,表征与标签之间的互信息($I(Y;Z)$)持续上升,而输入与表征互信息的上界($I_U(X;Z)$)持续下降,证实了无关因素的有效去除。
  • 超参数分析表明,最优性能在$\lambda_s = 10^{-4}$与$\lambda_t < \lambda_s$的中间值下取得,表明SVHN相比MNIST包含更多无关信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。