Skip to main content
QUICK REVIEW

[论文解读] Open Set Domain Adaptation: Theoretical Bound and Algorithm

Zhen Fang, Jie Lü|arXiv (Cornell University)|Jul 19, 2019
Domain Adaptation and Few-Shot Learning参考文献 50被引用 10
一句话总结

本文提出了首个针对开放集域自适应(UOSDA)的理论学习边界,引入了‘开放集差异’这一新概念,用于量化未知类别上的风险。基于该边界,本文提出了DAOD算法,一种通过最小化开放集差异实现分布对齐的算法,在无需标注数据的情况下有效识别未知目标样本,从而在基准数据集上实现了最先进性能。

ABSTRACT

The aim of unsupervised domain adaptation is to leverage the knowledge in a labeled (source) domain to improve a model's learning performance with an unlabeled (target) domain -- the basic strategy being to mitigate the effects of discrepancies between the two distributions. Most existing algorithms can only handle unsupervised closed set domain adaptation (UCSDA), i.e., where the source and target domains are assumed to share the same label set. In this paper, we target a more challenging but realistic setting: unsupervised open set domain adaptation (UOSDA), where the target domain has unknown classes that are not found in the source domain. This is the first study to provide a learning bound for open set domain adaptation, which we do by theoretically investigating the risk of the target classifier on unknown classes. The proposed learning bound has a special term, namely open set difference, which reflects the risk of the target classifier on unknown classes. Further, we present a novel and theoretically guided unsupervised algorithm for open set domain adaptation, called distribution alignment with ppen difference (DAOD), which is based on regularizing this open set difference bound. The experiments on several benchmark datasets show the superior performance of the proposed UOSDA method compared with the state-of-the-art methods in the literature.

研究动机与目标

  • 解决现有无监督域自适应方法的局限性,即假设源域与目标域具有共享的标签集。
  • 应对现实但具有挑战性的无监督开放集域自适应(UOSDA)场景,其中目标域包含源域中未出现的未知类别。
  • 通过推导明确考虑未知类别风险的理论学习边界,为UOSDA提供理论基础。
  • 设计一种基于理论指导的合理算法,利用推导出的边界提升泛化能力并减少UOSDA中的负迁移。

提出的方法

  • 推导出包含新颖术语‘开放集差异’的UOSDA理论学习边界,该术语反映了目标分类器在未知类别上的风险。
  • 提出DAOD(带开放差异的分布对齐)算法,在分布对齐过程中最小化开放集差异项。
  • 将分布差异最小化(通过域对齐)与开放集差异正则化相结合,实现源域与目标域的联合对齐,同时识别未知样本。
  • 采用基于置信度的阈值机制(通过${\rm OSNN}^{cv}$)根据嵌入分布区分目标中的已知与未知样本。
  • 通过$\sigma$引入流形正则化和权重衰减,以防止过拟合并提升泛化能力。
  • 使用多组件损失函数优化算法,平衡域对齐、开放集差异和正则化项。

实验结果

研究问题

  • RQ1无监督开放集域自适应的理论泛化边界是什么?它与封闭集域自适应边界有何不同?
  • RQ2在无监督设置下,如何形式化量化并最小化目标域中未知类别的风险?
  • RQ3能否设计一种基于理论的算法,有效识别未知目标样本,同时对齐源域与目标域的分布?
  • RQ4开放集差异、分布差异和正则化项在实现稳健UOSDA性能中的相对贡献是什么?

主要发现

  • DAOD在多个基准数据集上实现了最先进性能,优于现有SOTA方法在开放集域自适应中的表现。
  • 开放集差异项对于识别未知目标样本至关重要;若移除其贡献,性能显著下降。
  • 该算法收敛迅速,10次迭代内即达到稳定性能,表明其具有出色的训练效率。
  • 超参数敏感性分析表明,最优性能出现在$\alpha \approx 0.3$和$\gamma \approx 0.3$,当$\alpha > 0.4$或$\gamma < 0.15$时性能急剧下降。
  • 流形正则化($\rho$)对性能贡献极小,即使$\rho$取值在5至50之间,性能也略有下降,尽管在扩展实验中仍为必要项。
  • 权重衰减($\sigma$)对防止过拟合至关重要,当$\sigma = 0$时性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。