Skip to main content
QUICK REVIEW

[論文レビュー] Taming the Cross Entropy Loss

Manuel Martínez, Rainer Stiefelhagen|arXiv (Cornell University)|Oct 11, 2018
Adversarial Robustness in Machine Learning参考文献 15被引用数 5
ひとこと要約

本稿では、標準的な交差エントロピー損失のロバストな変種であるTamed Cross Entropy (TCE)損失を提案する。TCE損失は、元のCE損失の高速収束性を維持しながら、ラベルノイズに対して著しく向上したロバスト性を実現する。CE勾配にべき乗正規化を適用することで、低信頼度の予測に対する勾配更新を軽減し、訓練ハイパーパrameterの変更なしにノイズを効果的に抑制する。ResNet-20を用いたノイズのある画像データセットにおける実験では、80%のラベルノイズ下でCEに比べて最高で9.80%高いTop-1精度を達成した。

ABSTRACT

We present the Tamed Cross Entropy (TCE) loss function, a robust derivative of the standard Cross Entropy (CE) loss used in deep learning for classification tasks. However, unlike other robust losses, the TCE loss is designed to exhibit the same training properties than the CE loss in noiseless scenarios. Therefore, the TCE loss requires no modification on the training regime compared to the CE loss and, in consequence, can be applied in all applications where the CE loss is currently used. We evaluate the TCE loss using the ResNet architecture on four image datasets that we artificially contaminated with various levels of label noise. The TCE loss outperforms the CE loss in every tested scenario.

研究の動機と目的

  • 深層学習分類タスクにおける標準的交差エントロピー(CE)損失のラベルノイズに対する脆弱性を是正すること。
  • CEと同等の高速収束性と訓練挙動を維持しながら、ノイズありまたは誤標識データに対してよりロバストな損失関数を開発すること。
  • 訓練ルーチンやハイパーパrameterの変更なしにCEの即時置き換えが可能な損失関数を作成すること。
  • 人工的なラベル不正に起因する現実世界のシナリオにおいて、ラベルノイズに対するロバスト性と収束速度のトレードオフを評価すること。

提案手法

  • TCE損失は、標準的なCE損失の勾配にべき乗正規化を適用することで導出され、パラメータαで制御される。
  • 正規化により、モデルが自信を持っているとき(qi → 1)にTCE勾配がCE勾配と一致し、収束速度が保たれる。
  • モデルが不確実なとき(qi → 0)には、TCE勾配は0に近づき、誤標識または外れ値のサンプルからのフィードバックが低減される。
  • クリーンなデータ下でCEと同一の最適化ダイナミクスを維持するため、既存の訓練パイプラインと互換性を持つように設計されている。
  • TCEは、人工的に汚染されたラベルを用いたMNIST、CIFAR10+、CIFAR100+、VSHNでResNet-20を用いて評価された。
  • 感度と最適なトレードオフを評価するために、αの値の範囲(0.5から2.0)でテストされた。

実験結果

リサーチクエスチョン

  • RQ1修正された交差エントロピー損失は、標準的なCEの高速収束性を維持しながら、ラベルノイズに対してよりロバストであるか?
  • RQ2ランダムラベルノイズの増加に伴い、TCE損失はCE、MSE、MAEと比較してどのように性能を発揮するか?
  • RQ3TCE損失における正則化パラメータαの最適値は、ロバスト性と収束速度のバランスを取るためにどの程度か?
  • RQ4ハイパーパrameterチューニングなしにCEの直接置き換えとしてTCE損失を適用した場合、訓練の安定性と性能は保持されるか?

主な発見

  • 80%のランダムラベルノイズ下のCIFAR100+では、α = 1.5のTCEがTop-1精度87.30%を達成し、CEに比べて4.94ポイント高い性能を示した。
  • 80%のラベルノイズ下で、TCEはCIFAR100+でCEに比べて9.80%、CIFAR10+で9.36%、VSHNで4.94%高いTop-1精度を達成した。
  • α = 1.0のTCEは、収束速度がCEとほぼ同一であり、全ノイズレベルでCEよりも高い精度を達成した。
  • α > 1.5では収束が遅くなったが、MSEに比べて著しく速く、α = 1.5で良好なトレードオフが得られた。
  • 0%のラベルノイズ下でも、CE損失は時間経過とともに性能が低下する傾向を示し、固有の不安定性があることが示唆された。TCEとMSEはよりロバストであった。
  • TCE損失は、すべてのデータセットとノイズレベルで高い性能を維持し、0.5 ≤ α ≤ 2.0の範囲でαにほとんど感度を示さなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。