Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation via Calibrating Uncertainties

Ligong Han, Yang Zou|arXiv (Cornell University)|Jul 25, 2019
Domain Adaptation and Few-Shot Learning参考文献 28被引用 12
一句话总结

本文提出了一种新颖的无监督域自适应框架,通过Rényi熵正则化(RER)和梯度方差正则化(GVR)校准源域与目标域之间的预测不确定性。通过利用贝叶斯神经网络实现可靠的不确定性估计,并对齐不同域间的不确定性分布,该方法在数字图像分类和VisDA17基准上取得了最先进性能,在SVHN→MNIST任务上提升达25.4%,在VisDA17上提升达34.56%。

ABSTRACT

Unsupervised domain adaptation (UDA) aims at inferring class labels for unlabeled target domain given a related labeled source dataset. Intuitively, a model trained on source domain normally produces higher uncertainties for unseen data. In this work, we build on this assumption and propose to adapt from source to target domain via calibrating their predictive uncertainties. The uncertainty is quantified as the Renyi entropy, from which we propose a general Renyi entropy regularization (RER) framework. We further employ variational Bayes learning for reliable uncertainty estimation. In addition, calibrating the sample variance of network parameters serves as a plug-in regularizer for training. We discuss the theoretical properties of the proposed method and demonstrate its effectiveness on three domain-adaptation tasks.

研究动机与目标

  • 为解决无监督域自适应(UDA)中深度神经网络的不稳定性和过度自信问题,即模型对错误预测赋予过高置信度。
  • 通过在目标域数据上实现准确且可量化的不确定性估计,提升自训练中伪标签的可靠性。
  • 开发一种通用的、与模型无关的正则化框架,通过对齐源域与目标域间的不确定性分布,实现更优的域自适应。
  • 探索贝叶斯与频率学派的不确定性估计方法——分别采用变分推断与梯度方差正则化(GVR)——以提升模型鲁棒性。

提出的方法

  • 使用输出概率分布的Rényi熵量化预测不确定性,其中参数α作为Shannon熵与最小熵的推广。
  • 采用重参数化与蒙特卡洛采样的变分贝叶斯神经网络(BNNs),联合估计认知不确定性与随机不确定性。
  • 引入梯度方差正则化(GVR)作为即插即用的正则化项,通过控制训练过程中网络参数的样本方差来反映模型不确定性。
  • 提出Rényi熵正则化(RER)框架,在训练过程中最小化源域与目标域间不确定性差异。
  • 采用双头网络架构:一个头用于输出logits,另一个头用于log-variance of logits,实现不确定性感知的训练。
  • 通过最小化源域与目标域预测Rényi熵分布之间的差异,实现不确定性校准,促进通过不确定性一致性实现域对齐。

实验结果

研究问题

  • RQ1与标准熵最小化相比,基于Rényi熵的不确定性校准是否能提升无监督域自适应的性能?
  • RQ2在分布偏移情况下,引入贝叶斯神经网络是否能显著提升UDA中不确定性估计的可靠性?
  • RQ3网络参数的梯度方差能否作为一种有效且合理的正则化项,实现与模型无关的不确定性校准?
  • RQ4不确定性校准如何影响基于自训练的UDA中伪标签的稳定性和准确性?
  • RQ5不确定性校准在多大程度上能降低过度自信,并提升模型在未见目标域数据上的泛化能力?

主要发现

  • 在MNIST→USPS任务上,所提出的BRER-∞方法在引入GVR后达到94.53%的准确率,较基线DTN模型提升9.64%。
  • 在SVHN→MNIST任务上,BRER-∞结合GVR达到96.38%的准确率,较仅使用源域的基线模型提升25.40%。
  • 在VisDA17上,BRER-∞实现了80.59%的平均准确率,较非贝叶斯基ResNet101基线模型提升34.56%。
  • 在所有基准测试中,Rényi熵正则化中α=∞(最小熵)的设置在稳定性和准确性上均持续优于α=1(Shannon熵)。
  • 在RER-∞与BRER-∞设置中,GVR的引入提升了性能,但在RER-1设置中未见提升,表明其有效性与不确定性量化方法密切相关。
  • 贝叶斯基模型(BDTN、BRes101)优于其非贝叶斯基对应模型(DTN、ResNet101),证实了正确不确定性估计的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。