Skip to main content
QUICK REVIEW

[논문 리뷰] To Each Optimizer a Norm, To Each Norm its Generalization

Sharan Vaswani, Reza Babanezhad|arXiv (Cornell University)|2020. 06. 11.
Stochastic Gradient Optimization Techniques참고 문헌 20인용 수 6
한 줄 요약

이 논문은 선형 모델에서 최적화기(optimizer)가 찾는 임의의 보간 솔루션에 대응하는 암묵적 정규화 노름(정규화 범수)을 식별하기 위한 새로운 프레임워크를 제안한다. 기존의 최적화기가 알려진 노름을 최소화하는 문제를 뒤집어, 모든 보간 솔루션이 고유한 이차 노름을 최소화함을 보여줌으로써 일반화를 향상시키는 사영 기반 기법을 가능하게 한다. 특히 표준 ℓ₂ 노름 대비 데이터 유도 노름을 선호함으로써, 이론과 합성 실험을 통해 과소 및 과다 파rameter화된 설정 모두에서 향상된 테스트 성능을 입증한다.

ABSTRACT

We study the implicit regularization of optimization methods for linear models interpolating the training data in the under-parametrized and over-parametrized regimes. Since it is difficult to determine whether an optimizer converges to solutions that minimize a known norm, we flip the problem and investigate what is the corresponding norm minimized by an interpolating solution. Using this reasoning, we prove that for over-parameterized linear regression, projections onto linear spans can be used to move between different interpolating solutions. For under-parameterized linear classification, we prove that for any linear classifier separating the data, there exists a family of quadratic norms ||.||_P such that the classifier's direction is the same as that of the maximum P-margin solution. For linear classification, we argue that analyzing convergence to the standard maximum l2-margin is arbitrary and show that minimizing the norm induced by the data results in better generalization. Furthermore, for over-parameterized linear classification, projections onto the data-span enable us to use techniques from the under-parameterized setting. On the empirical side, we propose techniques to bias optimizers towards better generalizing solutions, improving their test performance. We validate our theoretical results via synthetic experiments, and use the neural tangent kernel to handle non-linear models.

연구 동기 및 목표

  • 과소 또는 과다 파arameter화로 인해 해가 무한히 존재하는 선형 모델에서 최적화 방법이 암묵적으로 최소화하는 노름을 규명하는 데 도전한다.
  • 기존 연구의 한계를 극복하기 위해, 수렴하는 해가 최소 ℓ₂-노름 또는 최대 ℓ₂-마진 해임을 전제로 하는 가정이 정당화되지 않은 채 사용되는 문제를 해결한다.
  • 주어진 보간 솔루션에 대해 그에 대응하는 이차 노름을 식별하는 방법을 개발하여, 일반화를 타겟으로 개선할 수 있도록 한다.
  • 선형 분류에서 데이터 유도 노름(예: 데이터 스펜 노름)이 표준 ℓ₂ 노름보다 일반화 성능이 뛰어나다는 것을 이론적·실증적으로 검증한다.
  • 데이터 스펜에 대한 사영을 통해 과소 파arameter화된 설정에서의 기법을 과다 파arameter화된 설정으로 확장하여 고차원 모델에서의 일반화를 향상시킨다.

제안 방법

  • 기존에 알려진 노름을 최소화하는지 묻는 것 대신, 보간 솔루션이 최소화하는 고유한 이차 노름 ∥⋅∥P 를 식별하는 이중적 시각을 제안한다.
  • 특히 데이터 스펜에 대한 사영을 통해 해를 변환하고 서로 다른 보간 솔루션 간에 이동함으로써 암묵적 편향을 제어할 수 있도록 한다.
  • 과소 파arameter화된 선형 분류에서, 임의의 선형 분리자 방향이 어떤 양의 정부호 행렬 P에 대해 최대 P-마진 솔루션과 동치임을 증명한다.
  • 과다 파arameter화된 설정에서 최적화기를 사용할 수 있도록 데이터 스펜 사영 기법을 도입하여, 데이터 유도 노름과의 일치를 통해 일반화 성능을 향상시킨다.
  • 데이터 공분산 행렬 Σ⁻¹ 를 사용한 전처리(preconditioning)를 적용하여 상대 마진(relative margin)을 최대화함으로써 베이즈 최적 분류기와의 일치도를 향상시킨다.
  • 비선형 모델로의 이론적 확장을 위해 신경접선핵(NTK)을 활용하여 결과를 더 넓은 맥락에서 검증한다.

실험 결과

연구 질문

  • RQ1주어진 최적화기로 찾은 선형 모델의 보간 솔루션에 대응하는 암묵적 정규화 노름은 무엇인가?
  • RQ2최적화기의 반복값을 데이터 스펜에 사영하는 것으로 일반화를 향상시킬 수 있으며, 이는 더 유리한 노름을 최소화하는 해로 이어지는가?
  • RQ3경사 하강법가 최소 ℓ₂-노름 해로 수렴한다는 표준 가정이 일반화 성능 측면에서 최적인지, 아니면 데이터 유도 노름이 더 나은 성능을 낼 수 있는가?
  • RQ4데이터 공분산 행렬 Σ⁻¹ 를 사용한 전처리가 선형 분류에서 최대 상대 마진 해로의 수렴에 어떤 영향을 미치는가?
  • RQ5과소 파arameter화된 설정에서의 기법을 데이터 스펜에 대한 사영을 통해 과다 파arameter화된 설정으로 확장하여 일반화 성능을 향상시킬 수 있는가?

주요 결과

  • 선형 회귀에서 모든 보간 솔루션은 고유한 이차 노름 ∥⋅∥P 를 최소화하며, 이는 암묵적 정규화를 체계적으로 분석하고 제어할 수 있는 방법을 제공한다.
  • 최적화기 반복값을 데이터 스펜에 사영하면 최소 ℓ₂-노름 해로 복구되며, 이는 회귀 및 분류 과제에서 일반화 성능을 크게 향상시킨다.
  • 과소 파arameter화된 선형 분류에서, 임의의 완벽한 분리자 방향은 어떤 양의 정부호 행렬 P에 대해 최대 P-마진 솔루션과 동치임을 보여주며, 노름 선택이 임의적이지 않음을 입증한다.
  • Σ⁻¹ 전처리를 통해 유도된 데이터 노름을 최소화하는 해는 ℓ₂-최대 마진 해보다 일반화 성능이 뛰어나며, 합성 실험을 통해 베이즈 최적 분류기와의 일치도 향상으로써 이를 입증한다.
  • 과다 파arameter화된 설정에서, Adagrad 및 경사 하강법의 반복값을 데이터 스펜에 사영하면 ℓ₂-노름과 최대 마진 해로의 각도가 감소하여 테스트 정확도가 높아지고 이상치에 대한 저항력도 향상된다.
  • 실증 결과로, Σ⁻¹ 전처리를 적용한 전처리된 경사 하강법이 더 높은 상대 마진과 더 나은 테스트 성능를 달성하며, 특히 표준 ℓ₂-마진 방법으로 오분류되는 테스트 포인트에서도 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.