Skip to main content
QUICK REVIEW

[論文レビュー] Positive Unlabeled Contrastive Learning

Anish Acharya, Sujay Sanghavi|arXiv (Cornell University)|Jun 1, 2022
Machine Learning and Data Classification被引用数 4
ひとこと要約

本稿では、クラス事前分布の推定を必要とせず、下流のPU分類性能を向上させるためにラベル付き陽性例と未ラベルデータを活用する対照的表現学習手法であるPositive Unlabeled Contrastive Learning (puCL) を提案する。本手法は新しい対照的損失関数とPU特有のクラスタリングに基づく疑似ラベル付け戦略を導入し、複数のベンチマークで最先端の性能を達成しており、特に低監視設定下でも顕著な優位性を示す。

ABSTRACT

Self-supervised pretraining on unlabeled data followed by supervised fine-tuning on labeled data is a popular paradigm for learning from limited labeled examples. We extend this paradigm to the classical positive unlabeled (PU) setting, where the task is to learn a binary classifier given only a few labeled positive samples, and (often) a large amount of unlabeled samples (which could be positive or negative). We first propose a simple extension of standard infoNCE family of contrastive losses, to the PU setting; and show that this learns superior representations, as compared to existing unsupervised and supervised approaches. We then develop a simple methodology to pseudo-label the unlabeled samples using a new PU-specific clustering scheme; these pseudo-labels can then be used to train the final (positive vs. negative) classifier. Our method handily outperforms state-of-the-art PU methods over several standard PU benchmark datasets, while not requiring a-priori knowledge of any class prior (which is a common assumption in other PU methods). We also provide a simple theoretical analysis that motivates our methods.

研究の動機と目的

  • ラベル付き陽性例が僅かで、大量の未ラベルサンプルしか入手できないという、陽性-未ラベル(PU)設定下での堅牢な二値分類器の学習という課題に対処すること。
  • 実際の状況ではしばしば不正確または入手困難であるため、従来のPU手法で一般的に仮定されているクラス事前分布πpに依存しないようにすること。
  • ラベル付き陽性例からの弱い監督を統合することで、PU設定下での表現学習を改善すること。
  • 学習済み表現に基づいてクラスタリングを用いることで、高品質な負例予測を生成する信頼性の高い疑似ラベル付けメカニズムを開発すること。
  • 追加の補助情報が不要な状態で、限られた監視下でも堅牢でありながら、PU学習で最先端の性能を達成すること。

提案手法

  • ラベル付き陽性サンプルを陽性ペアとして組み込むことで、標準的なinfoNCE対照的目的関数をPU設定に拡張した、修正された対照的損失(puCL)を提案する。
  • 未ラベルデータとわずかなラベル付き陽性例から判別性の高い表現を学ぶために、puCLを用いた自己教師付き対照的事前学習フェーズを導入する。
  • 学習済み表現に基づいて、未ラベル集合内の潜在的な負例を特定するためのPU特有のクラスタリング方式を開発する。
  • クラスタリングの結果を用いて未ラベル集合に疑似ラベルを適用し、下流の分類器学習のための信頼性の高い負例予測を生成する。
  • 疑似ラベル付きデータ上で交差エントロピー損失を用いて最終的な二値分類器を訓練する。この際、ラベル付き陽性例と疑似ラベル付き負例を統合する。
  • 2段階パイプラインを採用する:(1) puCLを用いた対照的事前学習、(2) 疑似ラベル付けの実施およびその後の教師あり微調整。

実験結果

リサーチクエスチョン

  • RQ1クラス事前分布の知識が不要な状況下でも、対照的自己教師付き学習をPU学習設定に効果的に適応させ、表現品質を向上させることができるか?
  • RQ2さまざまな監視レベル下で、バイアス-バリアンストレードオフの観点から、提案されたpuCL対照的目的関数は、標準的な自己教師付きおよび教師あり対照的学習と比較してどのように異なるか?
  • RQ3表現が十分に分離されている場合に、クラスタリングに基づく疑似ラベル付け戦略が、未ラベル集合内の負例を効果的に同定できるか?
  • RQ4提案手法は、ラベル付き陽性例の数が少ない状況でも、既存のPU学習ベースラインを上回る性能を示せるか?
  • RQ5性能が真のクラス事前分布πpにどれほど敏感であるか。また、πpが不明または不正確に推定されている場合でも、本手法が堅牢に保てるか?

主な発見

  • puCLは、評価されたすべてのデータセットおよび監視レベルで、標準的な自己教師付き対照的学習(ssCL)を顕著に上回り、ラベル付き陽性例の数が少ない場合に特に大きな向上が得られる。
  • クラス事前分布を組み込んだsCL-PU損失は、πpが0.5に近づくと性能が低下し、πpが1に近づくと崩壊する傾向にあり、事前分布推定誤差に極めて感受することが示された。
  • puCLは、πpの値が変化しても強固な性能を維持し、事前分布が不明または不正確であっても、従来のπpに依存する手法とは異なり、堅牢性を保つ。
  • 疑似ラベル付け手順(puPL)は、nnPUベースラインを常に上回り、特に低監視レジーム下で顕著な優位性を示す。また、標準的な交差エントロピー訓練で観察されるモデルの崩壊を防ぐ。
  • 疑似ラベルの品質は、表現の分離度と強く相関しており、対照的事前学習が下流の分類性能を向上させることを示している。
  • CIFAR-I、CIFAR-II、FMNIST-I、FMNIST-IIの各データセットで、真のクラス事前分布が利用可能であると仮定する手法を上回る最先端の結果を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。