[论文解读] Cluster Alignment with a Teacher for Unsupervised Domain Adaptation
该论文提出了一种新型无监督域自适应方法——教师模型引导的聚类对齐(Cluster Alignment with a Teacher, CAT),通过利用教师模型为目标域生成伪标签,增强特征的可分性。CAT联合优化源域和目标域中的类别条件聚类,并对齐跨域的对应聚类,从而学习更具判别性且域不变的特征空间,在标准基准上实现了最先进性能。
Deep learning methods have shown promise in unsupervised domain adaptation, which aims to leverage a labeled source domain to learn a classifier for the unlabeled target domain with a different distribution. However, such methods typically learn a domain-invariant representation space to match the marginal distributions of the source and target domains, while ignoring their fine-level structures. In this paper, we propose Cluster Alignment with a Teacher (CAT) for unsupervised domain adaptation, which can effectively incorporate the discriminative clustering structures in both domains for better adaptation. Technically, CAT leverages an implicit ensembling teacher model to reliably discover the class-conditional structure in the feature space for the unlabeled target domain. Then CAT forces the features of both the source and the target domains to form discriminative class-conditional clusters and aligns the corresponding clusters across domains. Empirical results demonstrate that CAT achieves state-of-the-art results in several unsupervised domain adaptation scenarios.
研究动机与目标
- 解决现有无监督域自适应方法仅对齐边缘分布而忽略特征空间中细粒度类别条件结构的局限性。
- 克服先前基于聚类方法的不足,这些方法依赖线性变换或高复杂度最近邻模型,与深度网络训练不兼容。
- 开发一种与深度学习兼容的框架,有效利用源域和目标域中的判别性聚类结构,实现更优的域自适应。
- 在域偏移严重、类别分布不均或模式分布差异显著等挑战性场景下实现更鲁棒的适应,此时仅靠边缘分布对齐已失效。
提出的方法
- 使用一个学生深度神经网络搭配教师分类器——即在源数据上训练的学生模型的隐式集成——为未标注的目标样本生成可靠的伪标签。
- 应用类别条件聚类损失,促使同一类别的特征在特征空间中紧密聚集,不同类别的特征相互分离。
- 引入条件特征匹配损失,对齐源域和目标域中对应类别的聚类。
- 通过联合使用监督损失(在有标签的源数据上)、聚类损失和聚类对齐损失,端到端训练模型,实现判别性表示与对齐表示的联合优化。
- 通过允许与JAN、RevGrad和rRevGrad等模型集成,确保与现有边缘分布对齐方法的兼容性。
- 使用t-SNE可视化特征空间,并通过K-means评估聚类准确率,以验证所学特征的判别性质量。
实验结果
研究问题
- RQ1在源域和目标域中同时引入类别条件聚类结构,是否能超越仅依赖边缘分布对齐的无监督域自适应性能?
- RQ2当域之间存在分布偏移时,教师模型在为未标注目标数据生成可靠伪标签方面效果如何?
- RQ3在域间强制执行类级别聚类对齐,是否比标准域对齐带来更好的泛化性能?
- RQ4在存在显著域偏移、类别不平衡或模式错位的场景下,所提方法能否超越现有SOTA方法?
主要发现
- 在SVHN到MNIST基准上,CAT与rRevGrad结合后,平均准确率达到87.3%,创下新SOTA,超越了JAN和RevGrad等先前方法。
- 在Office-Home数据集上使用ResNet-50时,CAT平均准确率达到86.3%,优于基线方法如JAN(85.8%)和RevGrad(85.0%)。
- rRevGrad+CAT学习到的特征经t-SNE可视化后,每类呈现紧密且清晰分离的聚类,表明其判别能力显著优于RevGrad,后者特征呈现重叠且结构松散。
- 在对齐特征上进行K-means聚类分析显示,rRevGrad+CAT的聚类准确率最高,证实所学特征空间中存在更丰富、更具判别性的聚类结构。
- 消融实验表明,类别条件聚类损失与聚类对齐损失均对性能提升有显著贡献,且教师模型在伪标签可靠性方面发挥关键作用。
- CAT与现有域对齐方法兼容,其与rRevGrad或JAN的集成在多个数据集和网络架构上均带来一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。