Skip to main content
QUICK REVIEW

[論文レビュー] Open-Sampling: Exploring Out-of-Distribution data for Re-balancing Long-tailed datasets

Hongxin Wei, Lue Tao|arXiv (Cornell University)|Jun 17, 2022
Domain Adaptation and Few-Shot Learning被引用数 15
ひとこと要約

本稿では、分布外(OOD)データを、元のクラス事前分布の補完的分布として定義された合成ノイズラベルと組み合わせることで、長尾データセットの再平衡化を図る新規手法Open-samplingを提案する。この手法により、クラス事前分布の整合性を保ちつつ、マイノリティクラスの性能と一般化性能が顕著に向上し、最先端手法を上回る結果を達成するとともに、クラス不均衡下でも強力なOOD検出が可能になる。

ABSTRACT

Deep neural networks usually perform poorly when the training dataset suffers from extreme class imbalance. Recent studies found that directly training with out-of-distribution data (i.e., open-set samples) in a semi-supervised manner would harm the generalization performance. In this work, we theoretically show that out-of-distribution data can still be leveraged to augment the minority classes from a Bayesian perspective. Based on this motivation, we propose a novel method called Open-sampling, which utilizes open-set noisy labels to re-balance the class priors of the training dataset. For each open-set instance, the label is sampled from our pre-defined distribution that is complementary to the distribution of original class priors. We empirically show that Open-sampling not only re-balances the class priors but also encourages the neural network to learn separable representations. Extensive experiments demonstrate that our proposed method significantly outperforms existing data re-balancing methods and can boost the performance of existing state-of-the-art methods.

研究の動機と目的

  • 現実世界のデータが本質的に不均衡であるため、長尾データセットにおけるマイノリティクラスにおけるモデル一般化性能の低さという課題に対処すること。
  • 半教師あり学習において有害とみなされてきた、未利用の分布外(OOD)データの潜在的価値を、長尾学習におけるデータ再平衡化の観点から探求すること。
  • 補完的ラベル分布とクラス依存の重み付けを用いることで、OODデータを過学習せずに活用する手法の開発。
  • OODデータを補助データとして用いることの理論的・実証的根拠を提示し、モデルのロバストネスと表現学習の向上を裏付けること。
  • 長尾学習における有効なオープンセット補助データセットの選定に関する実用的ガイドラインを提示すること。

提案手法

  • 元のクラス事前分布の補完的分布から事前に定義された分布に従い、OODインスタンスに合成ノイズラベルを割り当てるOpen-samplingという手法を導入する。
  • 損失関数においてクラス依存の重み付けスキームを用いることで、マイノリティクラスに対するより強い正則化を実現し、OODノイズへの過学習を軽減する。
  • 補完的分布は、標準的なクラスバランス分布よりも一様に近くなるように設計されており、OODラベルの有害性を低減する。
  • ベイジアンな視点を用いて、OODデータが事前分布の再平衡化と表現の分離性を向上させられることを理論的裏付けとする。
  • 大規模で現実的であるOODデータセットを補助データとして用い、クラス多様性よりもサンプルサイズと現実性に重点を置く。
  • 既存の最先端長尾学習手法とシームレスに統合可能であり、アーキテクチャの変更なしに性能向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1分布外(OOD)データを、モデル一般化性能を低下させることなく、長尾データセットの再平衡化に効果的に活用できるか?
  • RQ2OODサンプルのラベル分布の選定が、モデルの性能とロバストネスにどのように影響するか?
  • RQ3補助OODデータセットの特性(例:サイズ、多様性、現実性)の中で、再平衡化に最も重要な要因は何か?
  • RQ4Open-samplingは、長尾分類の向上に加え、分布外(OOD)検出性能の向上も実現するか?
  • RQ5Open-samplingは、既存の最先端長尾学習手法を強化するためのプラグインモジュールとして利用可能か?

主な発見

  • Open-samplingは、CIFAR-10/100、CelebA-5、Places-LTの4つの長尾ベンチマークにおいて、既存のデータ再平衡化手法を顕著に上回る性能を発揮した。
  • ベースライン手法と比較して、マイノリティクラスの平均精度が最大12.5%向上し、全データセットで一貫した向上が確認された。
  • クラスバランス分布ではなく補完的ラベル分布を用いることで、OODノイズの悪影響が軽減され、より優れた性能が得られた。
  • サンプルサイズが大きく、現実的なOODデータセットが最も優れた結果をもたらしたが、クラス多様性はデータの現実性と規模ほど重要ではなかった。
  • Open-samplingは、特徴のクラスタリングとマージン解析を通じて、学習された表現の分離性が向上していることが示された。
  • 訓練ラベルがノイズを含んでも、クラス不均衡下でOOD検出において最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。