[论文解读] Class-imbalanced Domain Adaptation: An Empirical Odyssey
本文提出了类别不平衡域自适应(CDA),一种现实的设定,其中特征分布和标签分布均在不同领域间发生偏移。提出COAL模型,通过联合对齐条件特征分布和标签分布,在包含22个跨域任务的新基准上显著优于现有方法,准确率最高提升5.2%。
Unsupervised domain adaptation is a promising way to generalize deep models to novel domains. However, the current literature assumes that the label distribution is domain-invariant and only aligns the feature distributions or vice versa. In this work, we explore the more realistic task of Class-imbalanced Domain Adaptation: How to align feature distributions across domains while the label distributions of the two domains are also different? Taking a practical step towards this problem, we constructed the first benchmark with 22 cross-domain tasks from 6real-image datasets. We conducted comprehensive experiments on 10 recent domain adaptation methods and find most of them are very fragile in the face of coexisting feature and label distribution shift. Towards a better solution, we further proposed a feature and label distribution CO-ALignment (COAL) model with a novel combination of existing ideas. COAL is empirically shown to outperform the most recent domain adaptation methods on our benchmarks. We believe the provided benchmarks, empirical analysis results, and the COAL baseline could stimulate and facilitate future research towards this important problem.
研究动机与目标
- 为解决当前无监督域自适应(UDA)方法的实际局限性,这些方法假设不同领域间标签分布相同,而现实中标签偏移却很常见。
- 证明现有UDA方法在同时存在特征与标签分布偏移时表现脆弱,常导致负迁移。
- 建立首个CDA的综合性基准,涵盖6个真实图像数据集的22个跨域任务。
- 提出并验证一种新颖的COAL框架,通过联合对齐条件特征分布与标签分布,实现鲁棒的域自适应。
- 提供实证证据与强基线,以激发未来针对鲁棒、现实适用的域自适应研究。
提出的方法
- 提出一种新的域自适应设定CDA,其中特征分布偏移(p(x) ≠ q(x))与标签分布偏移(p(y) ≠ q(y))共存,且p(x|y) ≠ q(x|y)。
- 引入双目标训练框架:(1) 基于原型的条件特征对齐自训练(L_ST),用于对齐每个类别内的特征;(2) 通过熵最小化与交叉熵损失实现标签分布对齐(L_H)。
- 采用平衡的源域采样器,减轻类别不平衡源数据带来的偏差,提升在标签偏移下的泛化能力。
- 使用ResNet-50主干网络进行特征表示学习,结合对抗域对齐,并在源域与伪标签化目标域数据上联合训练分类头。
- 在消融研究中,通过在平衡与不平衡标签设置之间进行线性插值,模拟不同程度的标签偏移。
- 采用t-SNE可视化定性评估跨域特征对齐质量,结果表明COAL在类别内聚类方面优于现有方法。
实验结果
研究问题
- RQ1现有最先进域自适应方法在同时存在特征与标签分布偏移时表现如何?
- RQ2不同程度的标签偏移对当前UDA方法性能有何影响?
- RQ3联合对齐条件特征分布与标签分布能否提升类别不平衡域自适应的鲁棒性?
- RQ4所提出COAL框架的各个独立组件对CDA性能有多关键?
- RQ5平衡源采样器在标签偏移下能否有效缓解性能下降?
主要发现
- 在所提出的CDA基准上,大多数现有UDA方法(包括DAN、DANN和MCD)在标签偏移下性能显著下降,某些情况下准确率降幅超过10%。
- 当标签偏移从0%增加到100%时,MCD方法的准确率从91.45%降至77.18%,表明其对标签分布偏移高度敏感。
- 在8项任务上,COAL平均准确率达到77.44%,优于最佳基线方法(MCD的74.46%),平均提升3.0%。
- 消融研究显示,若移除条件特征对齐(L_ST)或标签分布对齐(L_H)目标,COAL准确率分别下降2.6%和2.9%。
- COAL在不同标签偏移程度下保持稳定性能,USPS→MNIST任务中准确率在88.12%至93.42%之间波动,而基线方法则急剧下降。
- t-SNE可视化结果证实,与现有方法相比,COAL能实现更优的源域与目标域特征类别内对齐,避免错误的跨类别对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。