Skip to main content
QUICK REVIEW

[论文解读] On Pseudo-Labeling for Class-Mismatch Semi-Supervised Learning

Lu Han, Han-Jia Ye|arXiv (Cornell University)|Jan 15, 2023
Domain Adaptation and Few-Shot Learning被引用 6
一句话总结

该论文提出了 $Σ$-Model,一种用于类别不匹配的半监督学习的双分支框架,通过重新平衡高置信度伪标签以过滤分布外(OOD)数据,并对低置信度 OOD 数据进行语义聚类,从而改进伪标签化(PL)。该方法在多种基准测试中,于不同 OOD 比例下,持续优于监督基线方法和当前最先进方法。

ABSTRACT

When there are unlabeled Out-Of-Distribution (OOD) data from other classes, Semi-Supervised Learning (SSL) methods suffer from severe performance degradation and even get worse than merely training on labeled data. In this paper, we empirically analyze Pseudo-Labeling (PL) in class-mismatched SSL. PL is a simple and representative SSL method that transforms SSL problems into supervised learning by creating pseudo-labels for unlabeled data according to the model's prediction. We aim to answer two main questions: (1) How do OOD data influence PL? (2) What is the proper usage of OOD data with PL? First, we show that the major problem of PL is imbalanced pseudo-labels on OOD data. Second, we find that OOD data can help classify In-Distribution (ID) data given their OOD ground truth labels. Based on the findings, we propose to improve PL in class-mismatched SSL with two components -- Re-balanced Pseudo-Labeling (RPL) and Semantic Exploration Clustering (SEC). RPL re-balances pseudo-labels of high-confidence data, which simultaneously filters out OOD data and addresses the imbalance problem. SEC uses balanced clustering on low-confidence data to create pseudo-labels on extra classes, simulating the process of training with ground truth. Experiments show that our method achieves steady improvement over supervised baseline and state-of-the-art performance under all class mismatch ratios on different benchmarks.

研究动机与目标

  • 研究分布外(OOD)数据如何在半监督学习中降低伪标签化(PL)的性能。
  • 确定在未标记数据中存在 OOD 数据时,分配伪标签的最佳方式。
  • 开发一种鲁棒方法,使得当未标记数据中包含未见类别的 OOD 样本时,仍能保持或提升性能。
  • 解决 OOD 数据上伪标签的不平衡问题,并利用其语义结构以实现更好的泛化能力。

提出的方法

  • 该 $Σ$-Model 采用双分支架构:一个用于高置信度样本,另一个用于低置信度样本。
  • 重新平衡伪标签化(RPL)通过将每个类别截断至最小样本数,对高置信度数据的伪标签进行重新平衡,从而过滤 OOD 数据并缓解标签不平衡问题。
  • 语义探索聚类(SEC)对低置信度数据应用平衡聚类,生成额外类别的伪标签,模拟使用真实标签进行训练的效果。
  • SEC 利用聚类发现 OOD 数据中的语义结构,生成有意义的伪标签,而无需假设 OOD 类别的身份。
  • 该模型为 ID 和 OOD 数据使用独立的分类器,实现无干扰的独立学习。
  • 该方法对 OOD 数据分布的不平衡具有鲁棒性,且无需事先知晓 OOD 类别的数量。

实验结果

研究问题

  • RQ1OOD 数据如何影响半监督学习中伪标签化(PL)的性能?
  • RQ2为何在存在 OOD 数据时 PL 性能会下降,其根本原因是什么?
  • RQ3在基于 PL 的半监督学习中,为 OOD 数据分配伪标签的最佳策略是什么?
  • RQ4对 OOD 数据进行语义聚类是否能提升类别不匹配设置下的模型泛化能力?
  • RQ5聚类中使用的额外类别数量如何影响性能?

主要发现

  • 由于 OOD 数据上伪标签的不平衡,导致在类别不匹配情况下伪标签化性能显著下降,且 OOD 数据主导了训练信号。
  • 对高置信度样本的伪标签进行重新平衡可有效过滤 OOD 数据,并防止性能下降,其效果优于标准重加权方法。
  • 将低置信度 OOD 数据聚类为额外类别可提升性能,当额外类别数量与实际 OOD 类别数量相当时,性能达到最优。
  • $Σ$-Model 在 CIFAR-10 和 SVHN 上所有类别不匹配比率下均达到最先进性能,相较于监督基线方法最高提升达 5.2%。
  • 即使 OOD 数据分布不平衡,该方法依然有效,展现出对真实世界数据分布的鲁棒性。
  • 不确定性度量(如熵和得分差)可与 $Σ$-Model 有效结合,但 RPL 仍比基于重加权的方法更稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。