[论文解读] A Sample Selection Approach for Universal Domain Adaptation
本文提出一种用于通用域自适应(UDA)的样本选择方法,通过结合分类器置信度与域判别器不确定性的新评分机制,选择性地对共享类别中的目标样本进行伪标签化,从而提升性能。该方法引入了批量多样性损失以防止标签坍塌,并通过选择性标注与动态阈值策略,在Office31和OfficeHome基准上实现了最先进的准确率。
We study the problem of unsupervised domain adaption in the universal scenario, in which only some of the classes are shared between the source and target domains. We present a scoring scheme that is effective in identifying the samples of the shared classes. The score is used to select which samples in the target domain to pseudo-label during training. Another loss term encourages diversity of labels within each batch. Taken together, our method is shown to outperform, by a sizable margin, the current state of the art on the literature benchmarks.
研究动机与目标
- 解决源域与目标域存在部分类别重叠时的通用域自适应挑战,要求模型仅识别并分类共享类别。
- 通过仅对可能属于共享类别的目标样本进行选择性标注,降低UDA中错误伪标签化的风险。
- 通过在每个训练批次内强制实现标签多样性,防止模型坍塌为将所有目标样本预测为“未知”类别。
- 通过结合标签分类器置信度与域判别器不确定性的新颖评分机制,提升模型的泛化能力与鲁棒性。
- 在标准UDA基准上实现最先进性能,且相比先前方法,框架更简洁、更高效。
提出的方法
- 提出一种评分函数,结合标签分类器的置信度与域判别器的不确定性,以识别可能来自共享类别的目标样本。
- 仅对评分超过动态阈值的目标样本应用伪标签化,从而减少分布外样本导致的错误传播。
- 引入批量多样性损失,鼓励每个批次中预测标签在各类别间均匀分布,防止所有样本被分配至单一或少数几个类别。
- 在训练过程中采用基于模型置信度自适应调整的动态阈值策略,随着训练推进逐步放宽阈值,使更多高置信样本被伪标签化。
- 联合优化三种损失:域混淆损失、带样本选择的伪标签损失,以及批量多样性损失,共同训练模型。
- 在源域与目标域上均应用多样性损失,尽管实验表明仅在目标域上应用已能取得良好效果。
实验结果
研究问题
- RQ1结合标签分类器与域分类器输出的基于置信度的评分机制,能否提升通用域自适应中的样本选择性能?
- RQ2在每个训练批次内强制实现标签多样性,能否有效防止模型坍塌并提升UDA中的泛化能力?
- RQ3与固定阈值相比,伪标签化中的动态阈值策略在不同数据集上的性能与鲁棒性表现如何?
- RQ4当源域与目标域仅存在部分类别重叠时,所提方法是否比现有UDA方法更具有效性?
- RQ5与仅在目标域上应用多样性损失相比,在源域与目标域上均应用该损失,对模型性能的提升程度如何?
主要发现
- 所提方法在Office31与OfficeHome基准上均实现了最先进准确率,显著优于先前的SOTA方法。
- 使用动态阈值进行伪标签化相比固定阈值能提升性能,因其可在训练后期更有效地利用高置信样本。
- 在源域与目标域上均应用多样性损失时,性能略优于仅在目标域上应用,表明对源域预测进行正则化也具有优势。
- 结合标签分类器置信度与域判别器不确定性的评分机制,在识别共享类别样本方面优于先前提出的评分方法。
- 模型对决策阈值 $w_0$ 的变化具有鲁棒性,在 $w_0$ 范围(0 到 1.4)内准确率保持稳定,仅当 $w_0 > 1.4$ 时准确率急剧下降,证实了合理阈值校准的重要性。
- 实验表明,不同数据集与域偏移(如OfficeHome中的Ar→Cl,Office31中的A→D)的最优阈值不同,验证了动态阈值策略的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。