[论文解读] Progressively Select and Reject Pseudo-labelled Samples for Open-Set Domain Adaptation
该论文提出了一种新颖的开放集域自适应框架,通过开放集局部保持投影(OSLPP)逐步选择已知类伪标签样本并拒绝异常值作为未知类。OSLPP 学习一个共享子空间,使已知类的源域和目标域数据对齐,同时将未知类样本推开,实现在 Office-31 上 87.4% 的平均 HOS 和在 Office-Home 上 67.0% 的最先进性能。
Domain adaptation solves image classification problems in the target domain by taking advantage of the labelled source data and unlabelled target data. Usually, the source and target domains share the same set of classes. As a special case, Open-Set Domain Adaptation (OSDA) assumes there exist additional classes in the target domain but not present in the source domain. To solve such a domain adaptation problem, our proposed method learns discriminative common subspaces for the source and target domains using a novel Open-Set Locality Preserving Projection (OSLPP) algorithm. The source and target domain data are aligned in the learned common spaces class-wisely. To handle the open-set classification problem, our method progressively selects target samples to be pseudo-labelled as known classes and rejects the outliers if they are detected as from unknown classes. The common subspace learning algorithm OSLPP simultaneously aligns the labelled source data and pseudo-labelled target data from known classes and pushes the rejected target data away from the known classes. The common subspace learning and the pseudo-labelled sample selection/rejection facilitate each other in an iterative learning framework and achieves state-of-the-art performance on benchmark datasets Office-31 and Office-Home with the average HOS of 87.4% and 67.0% respectively.
研究动机与目标
- 为解决未知类样本与已知类未对齐所导致的开放集域自适应(OSDA)中的负迁移问题。
- 通过学习保持局部结构并分离已知类与未知类的公共子空间,改善源域与目标域之间的域对齐。
- 开发一种渐进式策略,用于选择可靠的伪标签样本并拒绝异常值,以减少迭代学习中的误差累积。
- 在基准 OSDA 数据集上实现最先进性能,同时保持对超参数选择的鲁棒性。
提出的方法
- 提出开放集局部保持投影(OSLPP),一种 LPP 的改进变体,其在共享子空间中对齐已知类的源域数据与伪标签目标域数据,同时将被拒绝的样本(异常值)从已知类中推开。
- 采用渐进式伪标签化策略:初始将目标样本标记为已知类,然后迭代选择可靠的样本并拒绝远离所有已知类的样本。
- 在 T 次迭代中交替进行基于 OSLPP 的子空间学习与伪标签选择/拒绝,实现对齐与异常值检测的相互优化。
- 在 OSLPP 之前使用 PCA 进行降维,以降低计算成本和噪声,子空间维度由超参数 $d_{PCA}$ 和 $d$ 控制。
- 应用 t-SNE 可视化以证明在学习到的公共子空间中,类别可分性与异常值分离性得到改善。
- 调整超参数 $n_r$(初始拒绝数量)和 $T$(迭代次数),以在已知类识别准确率(OS*)与未知类识别准确率(UNK)之间取得平衡,支持实际部署中的权衡。
实验结果
研究问题
- RQ1能否学习到一个共享子空间,同时对齐已知类的源域与目标域数据,并将未知类样本推开?
- RQ2对伪标签样本采用渐进式选择与拒绝策略,是否能减少误差累积并提升开放集域自适应中的泛化能力?
- RQ3与最先进方法相比,所提方法在已知类与未知类识别准确率的调和平均数(HOS)方面表现如何?
- RQ4该方法对超参数选择(如 $n_r$ 和 $T$)的鲁棒性如何?
- RQ5通过 t-SNE 可视化,该方法是否能有效在特征空间中将未知类样本与已知类分离?
主要发现
- 所提方法在 Office-31 数据集上实现了 87.4% 的最先进平均 HOS,在更具挑战性的 Office-Home 数据集上实现了 67.0% 的 HOS。
- 性能对超参数变化具有鲁棒性:在广泛范围的 $d_{PCA}$ 和 $d$ 值下均保持最优 HOS,尤其在 Office-Home 上表现突出。
- 增加 $n_r$ 和 $T$ 可提升未知类识别能力(UNK),但略微降低已知类准确率(OS*),从而实现两者之间的可调权衡。
- 该方法计算效率高,在标准笔记本电脑上完成 Office-31 任务耗时约 14 秒,Office-Home 任务耗时约 10 分钟。
- t-SNE 可视化证实,已知类的源域与目标域样本在公共子空间中对齐得更好,且未知类样本与已知类清晰分离。
- 该方法在调和平均数 HOS 方面对超参数不敏感,同时仍可通过 $n_r$ 和 $T$ 实现 OS* 与 UNK 之间的实用权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。