Skip to main content
QUICK REVIEW

[논문 리뷰] Are All Losses Created Equal: A Neural Collapse Perspective

Jin‐Xin Zhou, Chong You|arXiv (Cornell University)|2022. 10. 04.
Machine Learning and Data Classification인용 수 8
한 줄 요약

이 논문은 넓은 신경망에서 전역 최적화에 도달할 때, 교차 엔트로피, 레이블 스무딩, 포칼 손실, 평균 제곱 오차, 및 감독형 대비 손실과 같은 다양한 딥러닝 손실 함수들이 거의 동일한 테스트 성능을 낼 수 있음을 보여준다. 신경망 붕괴(Neural Collapse) 프레임워크를 사용하여, 모든 손실 함수가 훈련 데이터에서 동일한 최종 레이어 특징을 유도함을 보이며, 이는 그들의 경험적 차이가 최적화 부족에서 비롯되며 본질적인 우월성과는 무관하다는 것을 시사한다.

ABSTRACT

While cross entropy (CE) is the most commonly used loss to train deep neural networks for classification tasks, many alternative losses have been developed to obtain better empirical performance. Among them, which one is the best to use is still a mystery, because there seem to be multiple factors affecting the answer, such as properties of the dataset, the choice of network architecture, and so on. This paper studies the choice of loss function by examining the last-layer features of deep networks, drawing inspiration from a recent line work showing that the global optimal solution of CE and mean-square-error (MSE) losses exhibits a Neural Collapse phenomenon. That is, for sufficiently large networks trained until convergence, (i) all features of the same class collapse to the corresponding class mean and (ii) the means associated with different classes are in a configuration where their pairwise distances are all equal and maximized. We extend such results and show through global solution and landscape analyses that a broad family of loss functions including commonly used label smoothing (LS) and focal loss (FL) exhibits Neural Collapse. Hence, all relevant losses(i.e., CE, LS, FL, MSE) produce equivalent features on training data. Based on the unconstrained feature model assumption, we provide either the global landscape analysis for LS loss or the local landscape analysis for FL loss and show that the (only!) global minimizers are neural collapse solutions, while all other critical points are strict saddles whose Hessian exhibit negative curvature directions either in the global scope for LS loss or in the local scope for FL loss near the optimal solution. The experiments further show that Neural Collapse features obtained from all relevant losses lead to largely identical performance on test data as well, provided that the network is sufficiently large and trained until convergence.

연구 동기 및 목표

  • 다양한 손실 함수가 딥러닝에서 본질적으로 다른 일반화 성능을 초래하는지 조사하기.
  • 특정 손실 함수의 관찰된 경험적 우월성(예: 포칼 손실, 레이블 스무딩)이 최적화의 영향인지, 아니면 내재된 유도적 편향 때문인지 검토하기.
  • 이전에는 교차 엔트로피와 MSE에 대해서만 알려진 신경망 붕괴 현상을, 레이블 스무딩, 포칼 손실, 감독형 대비 손실을 포함한 광범위한 손실 함수의 클래스로 확장하기.
  • 훈련 데이터에서 동일한 신경망 붕괴 솔루션을 보이는 것이 다양한 손실 함수 간 거의 동일한 테스트 성능을 예측함을 확립하기.
  • 프로젝션 헤드와 정규화와 같은 아키텍처 구성 요소가 감독형 대비 손실(SupCon)의 성공에 기여하는 바를 명확히 하기.

제안 방법

  • 이론적 분석을 통해 CE, LS, FL, MSE, SupCon를 포함한 광범위한 손실 함수의 가족에 대해 신경망 붕괴 현상을 확장하였으며, 네트워크가 충분히 넓고 최적화가 잘 이루어질 경우 모든 손실 함수가 동일한 전역 최소화자를 갖는다는 것을 증명하였다.
  • 이러한 손실 함수들이 공유하는 대비 성질을 포괄하는 일반화된 손실 조건(정의 GLoss)을 도입하여, 이들의 전역 최적성에 대한 통합적 분석을 가능하게 하였다.
  • 모든 이러한 손실 함수에 대해 단일한 전역 최소화자인 심플렉스 ETF(Equiangular Tight Frames)가 존재함을 증명하였으며, 이는 훈련 데이터에서 동일한 특징 기하학을 보장한다.
  • CIFAR-10, CIFAR-100, 및 mini-ImageNet 데이터셋에서의 실험적 검증을 통해, 훈련이 수렴할 경우 모든 손실 함수 간 테스트 정확도가 거의 동일함을 확인하였다.
  • 헤시안 행렬의 구조에 대한 이론적 분석을 통해, 레이블 스무딩과 포칼 손실이 전역 또는 국소적으로 엄격한 안정점 함수이며, 임의의 기이한 국소 최소값이 존재하지 않음을 확인하였으며, 이는 최적 솔루션으로의 수렴을 지원한다.
  • 특징 공간의 회전 불변성에 기반하여, 다양한 손실 함수 간 동일한 신경망 붕괴 솔루션은 손실 형태의 차이에도 불구하고 동일한 테스트 성능을 암시함을 보였다.

실험 결과

연구 질문

  • RQ1모델이 전역 최적화에 도달할 경우, 다양한 딥러닝 손실 함수가 본질적으로 다른 테스트 성능을 초래하는가?
  • RQ2신경망 붕괴 현상은 넓은 신경망 내에서 다양한 손실 함수의 행동을 어느 정도 통합하는가?
  • RQ3이론적으로 전역 최적화 하에서 동일한 성능을 보이는 데도 불구하고, 일부 손실 함수(예: 포칼 손실, 레이블 스무딩)가 경험적으로 더 뛰어나 보이는 이유는 무엇인가?
  • RQ4감독형 대비 학습의 성공은 손실 함수 자체의 덕분인가, 아니면 프로젝션 헤드와 정규화와 같은 아키텍처 구성 요소 덕분인가?
  • RQ5훈련 데이터에서의 신경망 붕괴가 다양한 손실 함수 간 일반화 성능을 신뢰성 있게 예측할 수 있는가?

주요 결과

  • 검토된 모든 손실 함수—교차 엔트로피, 레이블 스무딩, 포칼 손실, 평균 제곱 오차, 감독형 대비 손실—은 넓은 네트워크에서 전역 최적화에 도달할 경우 동일한 테스트 성능을 낸다.
  • 모든 손실 함수의 최종 레이어 특징은 일반화된 손실 조건 하에서 공통된 전역 최소화자를 갖기 때문에, 훈련 데이터에서 동일한 심플렉스 ETF 구성으로 붕괴되며, 오직 회전의 차이만 존재한다.
  • 실험 결과는 훈련이 충분히 길어지고 네트워크가 넓어질수록 손실 간 테스트 정확도의 차이가 사라짐을 보이며, 이는 신경망 붕괴 하에서의 등가성을 뒷받침한다.
  • 이론적 분석을 통해, 레이블 스무딩과 포칼 손실이 전역 또는 국소적으로 엄격한 안정점 함수이며, 기이한 국소 최소값이 존재하지 않음을 확인하였으며, 이는 최적 솔루션으로의 수렴을 가능하게 한다.
  • 감독형 대비 손실의 성공은 손실 함수 자체보다는 주로 프로젝션 헤드와 특징 정규화의 사용에 기인함을 입증하였다.
  • 훈련 데이터에서의 신경망 붕괴가 모든 손실 함수 간 테스트 성능을 신뢰성 있게 예측하며, 일반화는 손실 형태가 아니라 최적화의 종점에 의해 결정됨을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.