Skip to main content
QUICK REVIEW

[論文レビュー] On Pseudo-Labeling for Class-Mismatch Semi-Supervised Learning

Lu Han, Han-Jia Ye|arXiv (Cornell University)|Jan 15, 2023
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

本稿では、クラス不一致を考慮した半教師あり学習のための二分岐型フレームワークである$Σ$-Modelを提案する。このモデルは、疑似ラベルの再平衡化により高信頼度の疑似ラベルをフィルタリングし、OODデータを除去することで、Pseudo-Labeling(PL)の性能を向上させる。また、低信頼度のOODデータに対しては意味的クラスタリングを適用し、一般化性能を向上させる。本手法は、さまざまなOOD比率の下で複数のベンチマークにおいて、教師ありベースラインおよび最先端手法を常に上回る性能を達成する。

ABSTRACT

When there are unlabeled Out-Of-Distribution (OOD) data from other classes, Semi-Supervised Learning (SSL) methods suffer from severe performance degradation and even get worse than merely training on labeled data. In this paper, we empirically analyze Pseudo-Labeling (PL) in class-mismatched SSL. PL is a simple and representative SSL method that transforms SSL problems into supervised learning by creating pseudo-labels for unlabeled data according to the model's prediction. We aim to answer two main questions: (1) How do OOD data influence PL? (2) What is the proper usage of OOD data with PL? First, we show that the major problem of PL is imbalanced pseudo-labels on OOD data. Second, we find that OOD data can help classify In-Distribution (ID) data given their OOD ground truth labels. Based on the findings, we propose to improve PL in class-mismatched SSL with two components -- Re-balanced Pseudo-Labeling (RPL) and Semantic Exploration Clustering (SEC). RPL re-balances pseudo-labels of high-confidence data, which simultaneously filters out OOD data and addresses the imbalance problem. SEC uses balanced clustering on low-confidence data to create pseudo-labels on extra classes, simulating the process of training with ground truth. Experiments show that our method achieves steady improvement over supervised baseline and state-of-the-art performance under all class mismatch ratios on different benchmarks.

研究の動機と目的

  • 分布外(OOD)データが半教師あり学習における疑似ラベル化(PL)の性能にどのように悪影響を及えるかを調査すること。
  • ラベルなしデータにOODデータが存在する状況で、疑似ラベルをOODデータにどのように割り当てるかの最適な方法を特定すること。
  • 未知のクラスからのOODサンプルを含むラベルなしデータにおいても、性能を維持または向上させる強力な手法を開発すること。
  • OODデータにおける疑似ラベルの不均衡を是正し、その意味的構造を活用してより良い一般化性能を達成すること。

提案手法

  • Σ$-Modelは二分岐アーキテクチャを採用しており、高信頼度のサンプルと低信頼度のサンプルにそれぞれ別々のブランチを設ける。
  • 再平衡化疑似ラベル化(RPL)は、各クラスのカウントを最小値に制限することで、高信頼度データにおける疑似ラベルの再平衡化を実現し、OODデータをフィルタリングし、ラベルの不均衡を軽減する。
  • 意味的探索クラスタリング(SEC)は、低信頼度データに対してバランスの取れたクラスタリングを適用し、追加のクラスに割り当てることで、真のラベルがあるかのように学習をシミュレートする疑似ラベルを生成する。
  • SECは、OODデータ内の意味的構造をクラスタリングにより発見し、OODクラスの識別子を事前に仮定せずに意味のある疑似ラベルを生成する。
  • モデルはIDデータとOODデータのための分離された分類器を用いることで、干渉を防ぎながら独立して学習を可能にする。
  • 本手法は、OODデータの分布が不均衡であっても耐性があり、OODクラス数の事前知識を必要としない。

実験結果

リサーチクエスチョン

  • RQ1OODデータは半教師あり学習における疑似ラベル化(PL)の性能にどのように影響を与えるか?
  • RQ2なぜOODデータが存在する際にPLの性能が低下するのか、その原因は何か?
  • RQ3PLに基づく半教師あり学習において、OODデータに疑似ラベルを割り当てる最適な戦略は何か?
  • RQ4OODデータの意味的クラスタリングは、クラス不一致設定におけるモデルの一般化性能を向上させることができるか?
  • RQ5クラスタリングに使用する追加クラスの数が性能に与える影響は何か?

主な発見

  • クラス不一致の状況では、OODデータにおける疑似ラベルの不均衡が顕著に顕在され、学習信号の大部分を占めるため、疑似ラベル化の性能が著しく低下する。
  • 高信頼度サンプルにおける疑似ラベルの再平衡化により、OODデータがフィルタリングされ、性能の低下が防止され、標準的な再重み付け手法を上回る性能を発揮する。
  • 低信頼度のOODデータを追加クラスに意味的クラスタリングすることで性能が向上し、追加クラス数が実際のOODクラス数と一致する際に最良の結果が得られる。
  • $Σ$-Modelは、CIFAR-10およびSVHNにおいて、すべてのクラス不一致比において最先端の性能を達成し、教師ありベースラインを最大5.2%上回る。
  • OODデータが不均衡であっても本手法は有効であり、現実のデータ分布に耐性があることが示された。
  • エントロピーとスコア差といった不確実性指標は$Σ$-Modelと効果的に組み合わせられるが、RPLは再重み付けに基づくアプローチよりもより安定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。