Skip to main content
QUICK REVIEW

[論文レビュー] Are All Losses Created Equal: A Neural Collapse Perspective

Jin‐Xin Zhou, Chong You|arXiv (Cornell University)|Oct 4, 2022
Machine Learning and Data Classification被引用数 8
ひとこと要約

この論文は、幅広いニューラルネットワークにおいて、グローバル最適化に達した場合、交差エントロピー、ラベルスムージング、フォーカル損失、平均二乗誤差、および教師付き対照的損失といった多様な深層学習損失関数が、ほぼ同一のテスト性能を示すことを示している。ニューラルコラプスフレームワークを用いて、すべての損失関数が訓練データ上の同一の最終層特徴をもたらすことを示し、それらの実証的差異は本質的優位性ではなく、最適化が不完全であることに起因することを示している。

ABSTRACT

While cross entropy (CE) is the most commonly used loss to train deep neural networks for classification tasks, many alternative losses have been developed to obtain better empirical performance. Among them, which one is the best to use is still a mystery, because there seem to be multiple factors affecting the answer, such as properties of the dataset, the choice of network architecture, and so on. This paper studies the choice of loss function by examining the last-layer features of deep networks, drawing inspiration from a recent line work showing that the global optimal solution of CE and mean-square-error (MSE) losses exhibits a Neural Collapse phenomenon. That is, for sufficiently large networks trained until convergence, (i) all features of the same class collapse to the corresponding class mean and (ii) the means associated with different classes are in a configuration where their pairwise distances are all equal and maximized. We extend such results and show through global solution and landscape analyses that a broad family of loss functions including commonly used label smoothing (LS) and focal loss (FL) exhibits Neural Collapse. Hence, all relevant losses(i.e., CE, LS, FL, MSE) produce equivalent features on training data. Based on the unconstrained feature model assumption, we provide either the global landscape analysis for LS loss or the local landscape analysis for FL loss and show that the (only!) global minimizers are neural collapse solutions, while all other critical points are strict saddles whose Hessian exhibit negative curvature directions either in the global scope for LS loss or in the local scope for FL loss near the optimal solution. The experiments further show that Neural Collapse features obtained from all relevant losses lead to largely identical performance on test data as well, provided that the network is sufficiently large and trained until convergence.

研究の動機と目的

  • 異なる損失関数が深層学習において根本的に異なる一般化性能をもたらすかどうかを調査すること。
  • フォーカル損失やラベルスムージングなどの一部の損失関数が観察される実証的優位性が、最適化の問題に起因するのか、それとも内因的バイアスに起因するのかを検討すること。
  • 従来、交差エントロピーとMSEに限られていたニューラルコラプス現象を、ラベルスムージング、フォーカル損失、および教師付き対照的損失を含む広範な損失関数クラスに拡張すること。
  • 訓練データ上での同等のニューラルコラプス解が、多様な損失関数間でほぼ同一のテスト性能を予測することを確立すること。
  • 投影ヘッドや正規化などのアーキテクチャ的要因が、SupConのような対照的損失の成功に果たす役割を明確にすること。

提案手法

  • 理論的分析により、CE、LS、FL、MSE、SupConを含む広い損失関数族が、十分な幅と最適化の下で同じグローバル最小化子をもたらすことを示し、ニューラルコラプス現象を拡張した。
  • これらの損失関数が共有する対照的性質を捉える一般化損失条件(定義GLoss)を導入し、それらのグローバル最適性を統一的に分析可能にした。
  • すべてのこのような損失関数に対して、単体ETF(等角フレーム)が一意のグローバル最小化子であることを証明し、訓練データ上の同一の特徴幾何を保証した。
  • CIFAR-10、CIFAR-100、およびmini-ImageNetデータセットにおける実験的検証により、収束に達した場合、すべての損失関数でテスト精度がほぼ同一であることが確認された。
  • ヘッセ行列構造の理論的分析により、ラベルスムージングおよびフォーカル損失がグローバルまたは局所的厳密なサドル関数であり、偽の局所最小値を有さないことが確認され、最適解への収束が可能であることを支持した。
  • 特徴空間の回転不変性を用いて、異なる損失形式であっても、同等のニューラルコラプス解が存在すれば、同等のテスト性能が得られることを示した。

実験結果

リサーチクエスチョン

  • RQ1モデルがグローバル最適化に達した場合、異なる深層学習損失関数が根本的に異なるテスト性能をもたらすのか?
  • RQ2ニューラルコラプス現象は、広いニューラルネットワークにおける多様な損失関数の挙動をどの程度統一的に説明できるのか?
  • RQ3理論的にはグローバル最適化下で同等であるにもかかわらず、フォーカル損失やラベルスムージングなどの一部の損失関数がなぜ実証的に優れているのか?
  • RQ4教師付き対照的学習の成功は、損失関数そのものに起因するのか、それとも投影ヘッドや正規化といったアーキテクチャ的要因に起因するのか?
  • RQ5訓練データ上でのニューラルコラプスは、異なる損失関数間で一般化性能を信頼性高く予測できるのか?

主な発見

  • 交差エントロピー、ラベルスムージング、フォーカル損失、平均二乗誤差、および教師付き対照的損失を含む、すべての検討された損失関数が、広いネットワークでグローバル最適化に達した場合、同一のテスト性能を示す。
  • すべての損失関数の最終層特徴は、一般化損失条件の下で共有されるグローバル最小化子のため、訓練データ上で同一の単体ETF構成に収束し、回転の違いを除いて同一である。
  • 実証的結果により、訓練が十分に長く、モデルが広い場合、損失関数間のテスト精度の差が消えることが示され、ニューラルコラプス下での等価性が裏付けられた。
  • 理論的分析により、ラベルスムージングおよびフォーカル損失がグローバルまたは局所的厳密なサドル関数であり、偽の局所最小値を有さないことが確認され、最適解への収束が可能であることが示された。
  • 教師付き対照的損失の利点は、主に投影ヘッドと特徴正規化の使用に起因しており、損失関数そのものに起因するものではないことが示された。
  • 訓練データ上でのニューラルコラプスは、すべての損失関数に対してテスト性能を信頼性高く予測でき、一般化性能は損失関数の形式ではなく、最適化の到達点によって決定されることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。