Skip to main content
QUICK REVIEW

[論文レビュー] Class2Simi: A Noise Reduction Perspective on Learning with Noisy Labels

Songhua Wu, Xiaobo Xia|arXiv (Cornell University)|Jun 14, 2020
Machine Learning and Data Classification被引用数 20
ひとこと要約

本稿では、ノイズのあるクラスラベルをノイズのある類似度ラベル(2つのサンプルが同じクラスに属するかどうかを示す)に変換する、新たなノイズ低減フレームワークClass2Simiを提案する。これにより、有効なノイズ率が低下する。元のノイズありポイントワイズラベルで事前学習した後、これらのペairワイズ類似度ラベルで深層ネットワークを訓練することで、特に高ノイズ率および遷移行列の推定誤差が生じる状況下でも、最先端のラベルノイズに対するロバスト性を達成する。

ABSTRACT

Learning with noisy labels has attracted a lot of attention in recent years, where the mainstream approaches are in pointwise manners. Meanwhile, pairwise manners have shown great potential in supervised metric learning and unsupervised contrastive learning. Thus, a natural question is raised: does learning in a pairwise manner mitigate label noise? To give an affirmative answer, in this paper, we propose a framework called Class2Simi: it transforms data points with noisy class labels to data pairs with noisy similarity labels, where a similarity label denotes whether a pair shares the class label or not. Through this transformation, the reduction of the noise rate is theoretically guaranteed, and hence it is in principle easier to handle noisy similarity labels. Amazingly, DNNs that predict the clean class labels can be trained from noisy data pairs if they are first pretrained from noisy data points. Class2Simi is computationally efficient because not only this transformation is on-the-fly in mini-batches, but also it just changes loss computation on top of model prediction into a pairwise manner. Its effectiveness is verified by extensive experiments.

研究の動機と目的

  • 大規模データセットにおける高ラベルノイズ下での深層ニューラルネットワークの学習という課題に対処すること。
  • データポイント間の関係性を活用するペアワイズ学習が、従来のポイントワイズ手法と比較して、ラベルノイズを内因的に緩和できるかどうかを調査すること。
  • ノイズのあるクラスラベルをノイズのある類似度ラベルに変換するフレームワークを開発し、有効なノイズ率を低減すること。
  • ノイズあり類似度ポストリアルとクリーンなクラスポストリアルの間の理論的かつ実用的な関連性を確立し、ロバストなモデル学習を可能にすること。
  • クラス遷移行列の推定誤差に対する本手法のロバスト性を示すこと。これは、ノイズありラベル学習の多くの手法で共通する課題である。

提案手法

  • 各訓練サンプルをノイズありクラスラベルで持ち、ペアワイズの類似度ラベル(2つのサンプルが同じクラスに属するか否か)を割り当てるデータペアに変換する。
  • 遷移行列の定式化を用いて理論的に、類似度ラベルのノイズ率がクラスラベルのノイズ率より低いことを証明する(定理2)。これは、類似度ラベルが個々のラベル誤りに対してより高い耐性を示すためである。
  • 標準的な交差エントロピー損失を用いて、元のノイズありポイントワイズデータで深層ニューラルネットワークを事前学習し、その後のペアワイズ学習に備えてセマンティッククラス情報の保持を図る。
  • ノイズあり類似度ラベルを補正するペアワイズ損失関数(例:ForwardまたはReweight)を用いてモデルをファインチューニングする。この際、内積近似を介してクリーンなクラスポストリアルを活用する。
  • クラス遷移行列から導出される類似度遷移行列を用いて、ペアワイズ監視におけるノイズをモデル化し、理論的ロバスト性を確保する。
  • ミニバッチ学習中にオンザフライで変換を実装し、計算オーバーヘッドを最小限に抑えつつ、効率的なペアワイズ学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ポイントワイズクラスラベルをペアワイズ類似度ラベルに変換することで、訓練データの有効なノイズ率を低減できるか?
  • RQ2ノイズあり類似度ラベルから学習することで、ノイズありクラスラベルから学習する場合と比較して、ディープニューラルネットワークの一般化性能が向上するか?
  • RQ3クラス遷移行列の推定誤差に対して、本手法はどの程度ロバストか?これは、多くのノイズありラベル学習手法の鍵となる要因である。
  • RQ4ノイズありポイントワイズデータで事前学習することで、十分なセマンティック情報を保持でき、その後のノイズありペアワイズラベルでの有効なファインチューニングが可能になるか?
  • RQ5対称的および非対称的ラベルノイズ設定下で、本手法のペアワイズ学習フレームワークは、既存の最先端のポイントワイズ手法を上回る性能を示すか?

主な発見

  • 図1に示すように、Class2Simiはクラスラベルのノイズ率0.5を類似度ラベルのノイズ率0.25に低減し、個々のラベル誤りに対する類似度ラベルの高い耐性のおかげである。
  • 60%のノイズ率を有するCIFAR-10およびCIFAR-100において、Class2Simiはベースラインのポイントワイズ手法と比較して、それぞれ約5点および10点の精度向上を達成した。
  • F-Class2SimiはClothing1M*で75.41%の精度を達成し、Co-teaching(74.70%)およびS2E(72.30%)を上回り、実世界のノイズありデータでも優れた性能を示した。
  • R-Class2SimiはClothing1M*で75.76%の精度を達成し、F-Class2Simiをさらに上回った。これは、重み付け変種の有効性を示している。
  • 真の遷移行列に摂動を加えても本手法はロバストである。一方で、Forwardの精度はノイズが加わると急激に低下するが、F-Class2Simiは僅かな変動しか示さず、ロバスト性が裏付けられた。
  • クリーンなデータセット(MNIST, CIFAR10, CIFAR100, News20)では、類似度損失が標準的な交差エントロピー損失と比較して顕著な精度向上を示さない。これは、ノイズあり設定での改善が損失設計によるものではなく、ノイズ低減によるものであることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。