Skip to main content
QUICK REVIEW

[论文解读] Subsidiary Prototype Alignment for Universal Domain Adaptation

Jogendra Nath Kundu, Suvaansh Bhambri|arXiv (Cornell University)|Oct 28, 2022
Domain Adaptation and Few-Shot Learning被引用 10
一句话总结

本文提出子模型原型对齐(Subsidiary Prototype Alignment, SPA),一种用于通用域适应(Universal Domain Adaptation, UniDA)的新框架,通过基于词袋视觉模型(Bag-of-Visual-Words, BoW)启发的表示方式学习中级视觉基元(词原型),以缓解负迁移问题。通过引入基于网格打乱图像块的自监督掩蔽任务以强制原型对齐,SPA 实现了目标特征与共享视觉基元之间的闭集对齐,在多个 UniDA 和开放集 DA 基准上实现了最先进性能,且计算开销极低。

ABSTRACT

Universal Domain Adaptation (UniDA) deals with the problem of knowledge transfer between two datasets with domain-shift as well as category-shift. The goal is to categorize unlabeled target samples, either into one of the "known" categories or into a single "unknown" category. A major problem in UniDA is negative transfer, i.e. misalignment of "known" and "unknown" classes. To this end, we first uncover an intriguing tradeoff between negative-transfer-risk and domain-invariance exhibited at different layers of a deep network. It turns out we can strike a balance between these two metrics at a mid-level layer. Towards designing an effective framework based on this insight, we draw motivation from Bag-of-visual-Words (BoW). Word-prototypes in a BoW-like representation of a mid-level layer would represent lower-level visual primitives that are likely to be unaffected by the category-shift in the high-level features. We develop modifications that encourage learning of word-prototypes followed by word-histogram based classification. Following this, subsidiary prototype-space alignment (SPA) can be seen as a closed-set alignment problem, thereby avoiding negative transfer. We realize this with a novel word-histogram-related pretext task to enable closed-set SPA, operating in conjunction with goal task UniDA. We demonstrate the efficacy of our approach on top of existing UniDA techniques, yielding state-of-the-art performance across three standard UniDA and Open-Set DA object recognition benchmarks.

研究动机与目标

  • 为解决通用域适应(UniDA)中的负迁移问题,其中域偏移和类别偏移共同导致模型性能下降。
  • 通过识别一个中级层作为负迁移风险(NTR)与域不变性得分(DIS)之间的最优平衡点,缓解网络各层中负迁移风险与域不变性之间的权衡。
  • 设计一个表示空间,使低级视觉基元(词原型)在已知类和未知类之间共享,从而实现稳健的对齐。
  • 设计一种自监督掩蔽任务,通过使用网格打乱的图像块强制子模型原型空间对齐(SPA),以指导特征学习。
  • 在标准 UniDA 和开放集 DA 基准上实现最先进性能,且计算成本极低。

提出的方法

  • 引入架构修改,显式学习词原型,并从中级特征生成词直方图输出。
  • 在词直方图层面最小化自熵损失,以促进稀疏性,从而提升内在类别结构的表示能力。
  • 提出一种新颖的掩蔽任务:分类贡献到网格打乱图像中的不同实例数量,该任务作为先验以减少词级别错位。
  • 利用该掩蔽任务指导词原型的学习,并强制目标特征与这些原型之间的闭集对齐,避免负迁移。
  • 将 SPA 损失与主 UniDA 目标结合,支持使用有标签源数据和无标签目标数据进行端到端训练。
  • 采用基于阈值的熵分类器评估已知-未知分类性能,使用固定熵阈值 ρ = log(|Cs|)/2。

实验结果

研究问题

  • RQ1深度神经网络中的中级层是否能平衡负迁移风险与域不变性,从而成为 UniDA 适应的最优位置?
  • RQ2基于词袋视觉模型(BoW)的中级特征表示是否能减少 UniDA 中已知类与未知类之间的错位?
  • RQ3基于网格打乱图像块的自监督掩蔽任务是否能有效指导共享视觉基元(词原型)的学习?
  • RQ4通过闭集对齐策略实现的子模型原型空间对齐(SPA)是否能在存在未知类的情况下优于现有 UniDA 方法?
  • RQ5引入 BoW 启发的架构修改在保持最先进性能的同时,其计算成本是多少?

主要发现

  • SPA 在三个标准 UniDA 和开放集 DA 基准上实现最先进性能,包括 Office-31,在三次运行中平均准确率达到 94.8%(OS)和 95.2%(OS*)。
  • 在 Office-31 数据集上,该方法在 A→W、A→D、D→W、W→D、D→A 和 W→A 六个域迁移设置下分别达到 96.1%、97.0%、96.2%、97.0%、96.0% 和 96.0% 的准确率,且在不同随机种子下方差极小。
  • 所提出的掩蔽任务显著提升了原型对齐效果,减少了词级别错位,并增强了词直方图表示的鲁棒性。
  • 计算开销极低:仅增加约 200 万个额外参数,且 MACS 仅从 4.120G 略增至 4.223G,仅靠架构修改本身带来的性能增益可忽略不计。
  • 该方法在所有设置下均优于强基线方法,包括 DCC(OS 94.0% vs. DCC 的 94.0%)、RTN、DANN、ATI-λ、OSBP、STA 和 InheriT。
  • 消融实验表明,架构修改与 SPA 掩蔽任务的组合至关重要,单独使用架构修改仅带来微小性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。