Skip to main content
QUICK REVIEW

[論文レビュー] How Does a Neural Network's Architecture Impact Its Robustness to Noisy Labels?

Jingling Li, Mozhi Zhang|arXiv (Cornell University)|Dec 23, 2020
Machine Learning and Data Classification参考文献 92被引用数 6
ひとこと要約

この論文は、ニューラルネットワークのアーキテクチャがノイズのあるラベルに対するロバストネスに与える影響を調査し、学習された表現の予測力によってロバストネスを測定するフレームワークを提案する。ノイズ下でも、ターゲット関数とよく整合したネットワークは、高いテスト誤差を示しても依然として強力な予測表現を維持し、特にクラス依存またはインスタンス依存のノイズ下で、最先端の手法を上回る性能を示す。

ABSTRACT

Noisy labels are inevitable in large real-world datasets. In this work, we explore an area understudied by previous works -- how the network's architecture impacts its robustness to noisy labels. We provide a formal framework connecting the robustness of a network to the alignments between its architecture and target/noise functions. Our framework measures a network's robustness via the predictive power in its representations -- the test performance of a linear model trained on the learned representations using a small set of clean labels. We hypothesize that a network is more robust to noisy labels if its architecture is more aligned with the target function than the noise. To support our hypothesis, we provide both theoretical and empirical evidence across various neural network architectures and different domains. We also find that when the network is well-aligned with the target function, its predictive power in representations could improve upon state-of-the-art (SOTA) noisy-label-training methods in terms of test accuracy and even outperform sophisticated methods that use clean labels.

研究の動機と目的

  • 深層学習における未だ十分に研究されていない分野である、ニューラルネットワークのアーキテクチャがノイズラベルに対するロバストネスに与える影響を調査すること。
  • 学習された表現における予測力の指標を用いて、アーキテクチャの整合性とロバストネスの関係を形式化すること。
  • アーキテクチャがターゲット関数とよく整合している場合、ノイズラベル環境下でも優れた性能を示すという仮説を実証的に検証すること。
  • クリーンラベルの入手が不可能な状況下でも、よく整合したネットワークが最先端のノイズラベル学習手法を上回ることを示すこと。
  • 実世界のノイズラベルデータセットにおいて、表現の予測力がクリーンラベルに依存する手法の性能を上回ることを示すこと。

提案手法

  • 少数のクリーンラベルから得た表現に対して線形モデルを訓練し、そのテスト精度を測定することでロバストネスを評価する(これを予測力と定義)。
  • [55] から適応したフレームワークを提案し、ネットワークのロバストネスとアーキテクチャ/ターゲット/ノイズ関数の整合性の関係を形式化する。
  • 分解可能な関数を用いた簡素化された理論的設定を採用:f(x) = fr(h(x)) および g(x) = gr(h(x)) で、fr は線形で h は学習可能。
  • 逐次学習を適用し、h と整合したサブ構造が、ノイズラベル下でも低予測誤差を維持できることを示す。
  • 合成グラフタスク(GNNのバリエーション)と画像データセット(例:Clothing1M)を用いて、さまざまなノイズタイプ下で実証的評価を実施。
  • ランダムノイズおよび現実的(クラス依存/インスタンス依存)ノイズ下で、アーキテクチャとノイズラベル手法(例:DivideMix)の性能を比較。

実験結果

リサーチクエスチョン

  • RQ1ターゲット関数とアーキテクチャが整合している場合、ネットワークのノイズラベルに対するロバストネスはどのように変化するか?
  • RQ2表現が予測可能であっても、テスト誤差が高いネットワークは、ラベルノイズに対して依然としてロバストであるか?
  • RQ3さまざまなアーキテクチャとノイズタイプ下で、表現の予測力とロバストネスの相関関係は成立するか?
  • RQ4よく整合したアーキテクチャは、特に現実的なノイズ下で、最先端のノイズラベル学習手法を上回ることができるか?
  • RQ5DivideMix などの最先端手法の性能は、ネットワークのターゲット関数との整合性に依存してどのように変化するか?

主な発見

  • ターゲット関数とよく整合したアーキテクチャを持つネットワークは、テスト精度が低くても、ノイズラベル下で依然として高い予測力を示す表現を維持しており、ノイズラベルに対するロバストネスを示している。
  • 合成グラフタスクにおいて、アルゴリズム的関数と整合したGNNバリエーションは、整合性が低い対照群と比較して、ノイズラベル下で顕著に高い予測力を示した。
  • 実世界のラベルノイズを持つClothing1Mデータセットにおいて、よく整合したネットワークは、クリーンラベルを活用する洗練された手法をも凌駆した。これは、アーキテクチャの整合性が実用的影響を持つことを示している。
  • ターゲット関数と整合性が低いネットワークでは、最先端手法(例:DivideMix)がほとんど改善効果を示さず、場合によっては性能が低下した。
  • よく整合したネットワークは、特にクラス依存またはインスタンス依存のノイズ下で、最先端手法の性能を向上させた。これは、既存手法が困難に感じている状況下での有効性を示している。
  • 理論的分析により、逐次学習の下で、h と整合したサブ構造からの表現は、ノイズデータで学習された場合でも、高い確率で低予測誤差(P ≤ ε)を維持することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。