Skip to main content
QUICK REVIEW

[論文レビュー] Tripartite: Tackle Noisy Labels by a More Precise Partition

Xuefeng Liang, Longshan Yao|arXiv (Cornell University)|Feb 19, 2022
Machine Learning and Data Classification被引用数 10
ひとこと要約

Tripartiteは、二重ネットワークの不一致とラベル予測の不一致を用いて、学習データをハード、ノイジィ、クリーンの3つのサブセットに画期的な三重分割を行う。これにより、ハードサンプルに対して低重み学習を実施し、ノイジィデータに対して自己教師あり学習を可能にし、5つのベンチマークデータセットで最先端の性能を達成。特に、特徴量の類似性により誤分類されやすいハードサンプルの識別を向上させ、実世界のノイジィデータにおいて、データ分割の質と利用効率を向上させることで顕著な性能向上を実現。

ABSTRACT

Samples in large-scale datasets may be mislabeled due to various reasons, and Deep Neural Networks can easily over-fit to the noisy label data. To tackle this problem, the key point is to alleviate the harm of these noisy labels. Many existing methods try to divide training data into clean and noisy subsets in terms of loss values, and then process the noisy label data varied. One of the reasons hindering a better performance is the hard samples. As hard samples always have relatively large losses whether their labels are clean or noisy, these methods could not divide them precisely. Instead, we propose a Tripartite solution to partition training data more precisely into three subsets: hard, noisy, and clean. The partition criteria are based on the inconsistent predictions of two networks, and the inconsistency between the prediction of a network and the given label. To minimize the harm of noisy labels but maximize the value of noisy label data, we apply a low-weight learning on hard data and a self-supervised learning on noisy label data without using the given labels. Extensive experiments demonstrate that Tripartite can filter out noisy label data more precisely, and outperforms most state-of-the-art methods on five benchmark datasets, especially on real-world datasets.

研究の動機と目的

  • 損失のみに依存する従来のサンプル選択手法では、ハードサンプルとノイジィまたはクリーンサンプルを区別できないという限界に対処すること。
  • 特徴量の類似性により誤分類されやすいハードサンプルを明示的に同定することで、クリーンおよびノイジィデータサブセットの品質を向上させること。
  • ノイズラベルによる被害を最小限に抑えつつ、ノイズラベル付きデータの有用性を最大限に活用するための、特化した学習戦略を採用すること。
  • 実世界のデータセットにおいて、曖昧で類似カテゴリの誤ラベルが存在する場合に、過学習を抑えるために、より正確なデータ分割メカニズムを提供すること。

提案手法

  • 二重ネットワークの予測不一致と、ネットワークの予測と与えられたラベルとの不一致に基づいて、学習データをハード、ノイジィ、クリーンの3つのサブセットに分割する。
  • ハードサンプルを、ラベルの正しさに関係なく、二つのネットワーク間の予測不一致が大きいサンプルとして特定する。
  • ノイジィサンプルを、ネットワークの予測と与えられたラベルが強く不一致するが、ネットワーク間の予測が一貫しているサンプルとして検出する。
  • ハードサンプルに対して低重み学習戦略を適用し、損失関数への寄与度を低くすることで、曖昧または誤ってラベル付けされたハードサンプルによる悪影響を最小限に抑える。
  • 与えられたラベルに依存せず、ノイジィラベル付きサンプルに対して自己教師あり学習を実施し、有用な特徴情報を保持する。
  • 三つのサブセットに応じて異なる学習戦略を別々に適用する訓練パイプラインに、三重分割戦略を統合し、一般化性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1ハードサンプルが存在する状況下で、従来の二重分割(クリーン/ノイジィ)と比較して、三重分割(ハード/ノイジィ/クリーン)戦略が優れているかどうか。
  • RQ2損失に基づく基準と比較して、二重ネットワークの予測不一致が、ハードおよびノイジィサンプルの特定精度をどのように向上させるか。
  • RQ3ノイジィラベル付きデータに対して自己教師あり学習を実施することで、ノイズラベルの悪影響をどれほど軽減でき、有用な情報をどれほど保持できるか。
  • RQ4ハードサンプルに対して低重み学習を適用することで、実世界のデータセットにおける曖昧または誤ってラベル付けされた例への過学習がどれほど軽減されるか。
  • RQ5対称的ノイズと現実的ノイズ(ハードサンプルの割合が非常に高い)の両方のノイズタイプに対して、Tripartite手法のロバストネスはどの程度か。

主な発見

  • 比較手法の中で、クリーンおよびノイジィサブセットのパーティショニング精度が最高であり、特に現実的ノイズ設定下でGMMおよび小損失基準を大きく上回る。
  • 50%の現実的ノイズを含むCIFAR-10では、Tripartiteが自己教師あり学習戦略により68.62%の精度を達成し、同じ設定下でドロップ戦略(65.04%)および半教師あり戦略(65.45%)を顕著に上回る。
  • ハードサンプルに対する最適な低重みハイパーパrameter λh = 0.6 が最良の性能をもたらす一方、λh = 0.2 ではハードクリーンサンプルからの学習が不十分で、性能が劣る。
  • ノイジィサブセットにおける自己教師あり学習戦略が最良の結果(50%の現実的ノイズ下で68.62%)を達成しており、疑似ラベルベースの半教師あり手法よりも優れていることが示された。
  • Tripartiteのパーティショニング品質は、モデル性能と直接相関しており、Co-teachingおよびDivideMixにおいてTripartiteでパーティショニングされたサブセットを用いることで、より高い精度が得られた。
  • 現実的ノイズを含むSVHNデータセットにおいて、Tripartiteは自己教師あり学習をノイジィデータに適用することで78.76%の精度を達成し、ドロップおよび半教師ありベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。