Skip to main content
QUICK REVIEW

[논문 리뷰] From Tempered to Benign Overfitting in ReLU Neural Networks

Guy Kornowski, Gilad Yehudai|arXiv (Cornell University)|2023. 05. 24.
Machine Learning and Data ClassificationComputer Science인용 수 3
한 줄 요약

이 논문은 노이즈가 있는 데이터에서 훈련된 두 층의 ReLU 신경망에서 온도 조절된 과적합에서 유익한 과적합으로의 전이를 이론적으로 조사한다. 입력 차원이 과적합 유형을 결정짓는 데 핵심적인 역할을 함을 보여주며, 낮은 차원(예: d=1)에서는 과적합이 온도 조절된 형태이지만, 차원이 증가함에 따라 과적합은 유익한 형태로 변화하며, 표준 가정 하에 고차원에서는 정제된 테스트 오차가 0으로 감소함을 시사한다.

ABSTRACT

Overparameterized neural networks (NNs) are observed to generalize well even when trained to perfectly fit noisy data. This phenomenon motivated a large body of work on "benign overfitting", where interpolating predictors achieve near-optimal performance. Recently, it was conjectured and empirically observed that the behavior of NNs is often better described as "tempered overfitting", where the performance is non-optimal yet also non-trivial, and degrades as a function of the noise level. However, a theoretical justification of this claim for non-linear NNs has been lacking so far. In this work, we provide several results that aim at bridging these complementing views. We study a simple classification setting with 2-layer ReLU NNs, and prove that under various assumptions, the type of overfitting transitions from tempered in the extreme case of one-dimensional data, to benign in high dimensions. Thus, we show that the input dimension has a crucial role on the type of overfitting in this setting, which we also validate empirically for intermediate dimensions. Overall, our results shed light on the intricate connections between the dimension, sample size, architecture and training algorithm on the one hand, and the type of resulting overfitting on the other hand.

연구 동기 및 목표

  • 비선형 설정에서 신경망이 온도 조절된 과적합인지 유익한 과적합인지 여부를 이해하는 데 이론적 간극을 메우기 위해.
  • 입력 차원, 표본 크기, 아키텍처가 노이즈가 있는 데이터에서 훈련된 ReLU 네트워크의 과적합 유형에 어떻게 영향을 미치는지 조사하기 위해.
  • 입력이 단위 구면 위에 균일하게 분포된 단순한 이진 분류 설정에서 과적합 행동을 철저히 특성화하기 위해.
  • 인터폴레이션 ReLU 네트워크가 온도 조절된 과적합이 아닌 유익한 과적합을 달성할 조건을 설정하기 위해.

제안 방법

  • 라벨 노이즈가 있는 이진 분류 문제에서 지수 꼬리 손실을 사용해 훈련된 두 층의 ReLU 신경망을 분석함.
  • 기존의 암묵적 편향 결과를 활용하여 최대 마진 문제의 KKT 점 수렴을 통한 훈련 동역학 모델링.
  • 기하 확률을 사용하여 단위 구면에서의 테스트 오차를 근사함; 특히 네트워크에 의해 잘못 분류되는 입력의 비율에 집중함.
  • 고차원 구면에 대한 농도 부등식(예: 보조정리 D.1 및 D.2)을 적용하여 네트워크 가중치가 데이터 포인트와 정렬되는 방식을 분석함.
  • 임의의 입력이 결정 경계의 잘못된 쪽에 있을 확률을 분석하여 정제된 테스트 오차의 경계를 유도함.
  • 고차원에서는 잘못 분류될 확률이 음성 예제의 수에 따라 지수적으로 감소함을 보여주며, 이는 유익한 과적합을 암시함.

실험 결과

연구 질문

  • RQ1입력 차원이 인터폴레이션 영역에서 ReLU 네트워크가 온도 조절된 과적합인지 유익한 과적합인지 여부를 결정짓는가?
  • RQ2낮은 차원에서 관찰되는 온도 조절된 과적합의 경험적 관찰을 이론적으로 설명할 수 있는가?
  • RQ3다양한 입력 차원에서 라벨 노이즈 수준 p에 따라 네트워크의 일반화 오차는 어떻게 스케일링되는가?
  • RQ4두 층의 ReLU 네트워크가 노이즈가 있는 데이터를 완벽하게 피팅함에도 불구하고, 어떤 조건에서 거의 최적의 일반화를 달성할 수 있는가?

주요 결과

  • 일차원 입력 공간에서는 정제된 테스트 오차가 Θ(poly(p))로 스케일링되며, 이는 노이즈 수준에 비례하는 온도 조절된 과적합을 확인함.
  • 고차원 입력(예: d ≥ 3)에서는 입력 차원이 증가함에 따라 정제된 테스트 오차가 0으로 감소함을 보여주며, 이는 유익한 과적합을 시사함.
  • 네트워크가 최대 마진 문제의 국소 최솟값으로 수렴할 경우, 정제된 테스트 오차는 O(1/2^k)로 경계지며, 여기서 k는 음성 예제의 수이므로 잘못 분류될 확률이 지수적으로 감소함을 의미함.
  • 온도 조절된 과적합에서 유익한 과적합으로의 전이는 네트워크의 너비가 아니라 입력 차원에 의해 주로 이끌리며, 인터폴레이션을 가능하게 하는 충분한 너너가 확보되어 있는 한 성립함.
  • 실험적 검증을 통해 중간 차원에서 이론적 전이가 확인되었으며, 노이즈에 대한 오차 스케일링이 선형에서 비선형으로 점차 전이됨을 보여줌.
  • 단위 구면 상의 임의의 입력이 결정 경계의 잘못된 쪽에 있을 확률은 1/2 - 1/2^k 이하로 경계지며, 이는 고차원에서는 무시할 수 없게 감소함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.