Skip to main content
QUICK REVIEW

[논문 리뷰] Can Implicit Bias Explain Generalization? Stochastic Convex Optimization as a Case Study

Assaf Dauber, Meir Feder|arXiv (Cornell University)|2020. 03. 13.
Machine Learning and Algorithms참고 문헌 30인용 수 7
한 줄 요약

이 논문은 확률적 볼록 최적화에서 SGD의 일반화를 설명하는 데 암묵적 편향이 가능한지 조사한다. 이를 위해, 강력한 볼록성 또는 노름 기반 정규화와 같은 분포에 독립적이거나 넓은 분포 의존 정규화자들—모든 경우에 대해 일관되게 일반화를 설명할 수 없다는 반례를 제시한다. 이는 과다 매개변수화된 학습에서 암묵적 편향이 일반화 메커니즘으로서의 보편성을 도전한다.

ABSTRACT

The notion of implicit bias, or implicit regularization, has been suggested as a means to explain the surprising generalization ability of modern-days overparameterized learning algorithms. This notion refers to the tendency of the optimization algorithm towards a certain structured solution that often generalizes well. Recently, several papers have studied implicit regularization and were able to identify this phenomenon in various scenarios. We revisit this paradigm in arguably the simplest non-trivial setup, and study the implicit bias of Stochastic Gradient Descent (SGD) in the context of Stochastic Convex Optimization. As a first step, we provide a simple construction that rules out the existence of a \emph{distribution-independent} implicit regularizer that governs the generalization ability of SGD. We then demonstrate a learning problem that rules out a very general class of \emph{distribution-dependent} implicit regularizers from explaining generalization, which includes strongly convex regularizers as well as non-degenerate norm-based regularizations. Certain aspects of our constructions point out to significant difficulties in providing a comprehensive explanation of an algorithm's generalization performance by solely arguing about its implicit regularization properties.

연구 동기 및 목표

  • 과다 매개변수화된 모델에서 암묵적 정규화가 일반화를 보편적으로 설명할 수 있는지 조사한다. 특히, 확률적 볼록 최적화(Stochastic Convex Optimization, SCO)에 초점을 맞춘다.
  • 확률적 볼록 최적화에서 SGD의 행동을 지배하는 분포에 독립적인 암묵적 정규화자가 존재하지 않음을 배제한다.
  • 특히 강력한 볼록성 또는 노름 기반 정규화자가 일반화를 설명할 수 있는지 조사한다.
  • 명시적인 구성을 통해 일반화를 암묵적 정규화로만 설명하는 데서 기초적인 한계를 드러낸다.
  • 간단한 볼록 설정에서도 일반 정규화자가 선호하는 해를 피할 수 있음을 보여주어, SGD가 일반화된 해에 수렴하지 않을 수 있음을 시사한다.

제안 방법

  • SGD가 유클리드 노름으로 가장 가까운 최소화자로 수렴하지 않는 단일 매끄러운 볼록 함수의 분포를 구성함으로써, 분포에 독립적인 암묵적 정규화가 불가능함을 입증한다.
  • 최소화자들이 평평한 구역을 이룬 함수에 대해 고정 단계 크기의 경사 하강법를 적용하여, L2 노름에서 가장 가까운 해로부터의 이탈을 보여준다.
  • 집중 불등식과 반사 원리를 사용하여, SGD가 최적 해 주변의 원하는 영역을 벗어나는 확률을 근사한다.
  • 학습 데이터에 무작위로 변형을 가해 쌍체 샘플 $ S' $ 를 생성함으로써, 다양한 조건 하에서 SGD의 행동을 비교할 수 있도록 한다.
  • Hoeffding의 부등식과 Lemma 2의 수정된 버전(정규 분포 尾부 경계에 관한)을 사용하여, 매개변수 경로가 원하는 영역에서 벗어나는 정도를 제어한다.
  • 다중 오류 사건($ E_1 $, $ E_2 $, $ E $)의 경계를 조합하여, SGD가 잘 정규화된 해로 수렴하지 못할 확률에 대한 고확률 상한을 유도한다.

실험 결과

연구 질문

  • RQ1분포에 독립적인 암묵적 정규화자가 확률적 볼록 최적화에서 SGD의 일반화 성능을 설명할 수 있는가?
  • RQ2강력한 볼록성 또는 노름 기반 정규화자가 SCO에서 SGD의 일반화 행동을 설명하는 데 기여하는가?
  • RQ3정규화자가 데이터 분포에 따라 달라지더라도, 암묵적 정규화로 일반화를 설명하는 데 기초적인 제약이 존재하는가?
  • RQ4간단한 볼록 설정에서도 SGD가 일반적으로 사용되는 정규화자가 선호하는 해를 피할 수 있음을 보일 수 있는가?
  • RQ5이러한 실패의 결과가 과다 매개변수화된 학습에서 암묵적 정규화 이론 전반에 미치는 영향은 무엇인가?

주요 결과

  • 논문은 단일 매끄러운 볼록 함수의 분포를 구성하여, SGD가 유클리드 노름으로 가장 가까운 최소화자로 수렴하지 않음을 입증함으로써, 분포에 독립적인 암묵적 정규화자가 존재하지 않음을 배제한다.
  • 고정 단계 크기의 경사 하강법조차도 L2 노름으로 가장 가까운 최소화자로 수렴하지 못함을 보여주어, L2 정규화가 SGD의 암묵적 편향이라는 개념에 도전한다.
  • 모든 강력한 볼록성 및 비퇴화된 노름 기반 정규화자를 포함한 광범위한 분포 의존 정규화자들의 일반화 설명 가능성은 차원과 표본 크기가 유사한 영역에서 배제된다.
  • 확률적 경계를 통해, SGD가 최적 해 주변의 원하는 영역을 벗어나는 확률이 $ rac{eta c}{32} $ 에 따라 지수적으로 감소함을 보여주며, 여기서 $ c = heta( ext{단계 크기} imes ext{sqrt}(T)) $ 이다. 이는 특정 조건 하에서 높은 실패 확률을 암시한다.
  • 분석 결과, SGD의 일반화 성능은 암묵적 정규화로만 완전히 설명될 수 없으며, 특히 정규화자가 데이터 분포에 따라 달라질 경우 더욱 그렇다.
  • 결과적으로, 암묵적 편향만으로는 현대 학습 알고리즘의 일반화를 설명하는 데 부족할 수 있으며, 이는 보다 다른 이론적 프레임워크의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.