[论文解读] Unsupervised Domain Adaptation via Structured Prediction Based Selective Pseudo-Labeling
本文提出了一种基于结构化预测的有选择性伪标签生成的新型无监督域自适应方法,以提高伪标签准确性并减少误差累积。通过利用K均值聚类挖掘目标域特征中的结构模式,并结合有监督局部保持投影迭代优化伪标签,该方法在四个基准数据集上实现了最先进性能,Office-Caltech数据集上的平均准确率最高达93.0%,Office-Home数据集上达71.0%。
Unsupervised domain adaptation aims to address the problem of classifying unlabeled samples from the target domain whilst labeled samples are only available from the source domain and the data distributions are different in these two domains. As a result, classifiers trained from labeled samples in the source domain suffer from significant performance drop when directly applied to the samples from the target domain. To address this issue, different approaches have been proposed to learn domain-invariant features or domain-specific classifiers. In either case, the lack of labeled samples in the target domain can be an issue which is usually overcome by pseudo-labeling. Inaccurate pseudo-labeling, however, could result in catastrophic error accumulation during learning. In this paper, we propose a novel selective pseudo-labeling strategy based on structured prediction. The idea of structured prediction is inspired by the fact that samples in the target domain are well clustered within the deep feature space so that unsupervised clustering analysis can be used to facilitate accurate pseudo-labeling. Experimental results on four datasets (i.e. Office-Caltech, Office31, ImageCLEF-DA and Office-Home) validate our approach outperforms contemporary state-of-the-art methods.
研究动机与目标
- 为解决无监督域自适应中源域与目标域数据分布不同所带来的域偏移问题。
- 提升对无标签目标样本进行伪标签生成的可靠性,这对域对齐和模型性能至关重要。
- 通过利用目标域特征中的结构信息,减少因伪标签不准确导致的灾难性误差累积。
- 设计一种有选择性的伪标签生成策略,结合聚类与结构化预测以提升标签质量。
- 通过结合深度特征与迭代优化的混合方法,在标准无监督域自适应基准上实现最先进性能。
提出的方法
- 在目标域的深度特征上应用K均值聚类,以识别自然分组并挖掘结构模式。
- 采用结构化预测基于聚类级别的一致性分配伪标签,相比独立标注,显著提升标签可靠性。
- 引入有选择性的伪标签生成策略,仅对高置信度或聚类一致的样本赋予伪标签,从而降低噪声。
- 使用有监督局部保持投影(SLPP)学习一个结合源域标签数据与选定目标域伪标签数据的域不变子空间。
- 该框架为迭代式设计:交替执行伪标签生成、子空间学习与模型优化,逐步提升模型泛化能力。
- 对超参数(如PCA维数d₁、SLPP维数d₂及迭代次数T)进行调优,发现当d₂ > 类别数时性能对参数变化不敏感。
实验结果
研究问题
- RQ1基于聚类的结构化预测能否提升无监督域自适应中伪标签生成的准确性?
- RQ2基于聚类结构的有选择性伪标签生成是否相比全局或独立标注能更有效地减少误差累积?
- RQ3结合SLPP与结构化伪标签的迭代优化能否在标准无监督域自适应基准上超越现有最先进方法?
- RQ4所提方法对超参数(如PCA与SLPP空间的维数)的敏感性如何?
- RQ5组件消融实验(如结构化预测与最近邻类别原型对比)对最终性能的影响程度如何?
主要发现
- 在Office-Caltech数据集上,所提方法平均准确率达到93.0%,优于MEDA(92.8%),创下新最先进水平。
- 在Office31数据集上,六项任务中有五项达到最佳或第二佳表现,平均准确率达89.6%,超过SymNets(88.4%)及其他SOTA模型。
- 在ImageCLEF-DA数据集上,方法取得最高平均准确率90.5%,优于SymNets(89.9%)与MEDA(89.0%)。
- 在具有挑战性的Office-Home数据集上,方法实现71.0%的平均准确率,优于CAPLS(70.6%)与SymNets(67.6%),展现出在大规模数据上的鲁棒性。
- 消融实验表明,结合结构化预测的有选择性伪标签生成显著提升性能,完整方法在Office-Home上达到71.0%准确率,较无选择策略的基线提升2.8%。
- 该方法对超参数表现出极低敏感性,当d₂ > 类别数时性能稳定,且迭代次数T > 2对性能影响可忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。