Skip to main content
QUICK REVIEW

[논문 리뷰] Overfitting Can Be Harmless for Basis Pursuit, But Only to a Degree

Peizhong Ju, Xiaojun Lin|arXiv (Cornell University)|2020. 02. 02.
Sparse and Compressive Sensing Techniques참고 문헌 39인용 수 8
한 줄 요약

이 논문은 $p$ (특징 수)가 $n$ (표본 수)를 초과하는 과다파rameter화된 영역에서 $\ell_1$-노름 최소화 방법인 Basis Pursuit (BP)를 분석한다. BP를 통한 오버피팅이 해로울 수 없음을 보이며, 일반화 오차는 $p$가 $n$의 지수적 규모에 이르기까지 증가함에 따라 감소함을 보여준다. 핵심 결과는 $p$에 따라 감소하는 비점근적이고 고확률적인 모델 오차 상한선으로, 이는 min-$\ell_2$-노름 해와는 다를 바 있는 이중내림(curve) 행동을 입증한다.

ABSTRACT

Recently, there have been significant interests in studying the so-called "double-descent" of the generalization error of linear regression models under the overparameterized and overfitting regime, with the hope that such analysis may provide the first step towards understanding why overparameterized deep neural networks (DNN) still generalize well. However, to date most of these studies focused on the min $\ell_2$-norm solution that overfits the data. In contrast, in this paper we study the overfitting solution that minimizes the $\ell_1$-norm, which is known as Basis Pursuit (BP) in the compressed sensing literature. Under a sparse true linear regression model with $p$ i.i.d. Gaussian features, we show that for a large range of $p$ up to a limit that grows exponentially with the number of samples $n$, with high probability the model error of BP is upper bounded by a value that decreases with $p$. To the best of our knowledge, this is the first analytical result in the literature establishing the double-descent of overfitting BP for finite $n$ and $p$. Further, our results reveal significant differences between the double-descent of BP and min $\ell_2$-norm solutions. Specifically, the double-descent upper-bound of BP is independent of the signal strength, and for high SNR and sparse models the descent-floor of BP can be much lower and wider than that of min $\ell_2$-norm solutions.

연구 동기 및 목표

  • 과다파라미터화된 영역에서 $p > n$ 인 경우 $\ell_1$-노름을 최소화하는 Basis Pursuit (BP)의 일반화 성능을 분석하는 것.
  • 유한한 $n$과 $p$에 대해 BP의 모델 오차에 대한 최초의 비점근적이고 고확률적인 상한선을 확립하는 것.
  • BP의 이중내림 행동을 min-$\ell_2$-노름 해와 비교하여 신호 강도 의존성과 내림구간 폭 측면에서 분석하는 것.
  • $\ell_1$-기반 오버피팅 해(스pars티를 촉진함)가 딥 네URAL 네트워크에서 관찰되는 것처럼 완벽한 학습 피팅에도 불구하고 잘 일반화될 수 있는지 조사하는 것.
  • 고신호대역비(SNR)와 높은 스파arsity 조건에서도 BP가 낮고 넓은 내림구간을 보이는 조건을 규명하는 것.

제안 방법

  • 독립 동일분포(i.i.d.) 가우시안 특징을 가진 스파스 선형 회귀 모델과 진짜 모델의 스파arsity $s$를 사용한다.
  • Basis Pursuit (BP)를 정확한 데이터 피팅(인터폴레이션) 조건 하에 $\ell_1$-노름을 최소화하는 해로 분석한다.
  • 집중 불등식과 카이제곱 尾부 한계를 활용하여 $\min_i |\mathbf{A}_{i1}|$의 고확률 하한선을 도출함으로써 해의 안정성과 관련된 결과를 도출한다.
  • 가우시안 꼬리 추정과 로그 근사법을 적용하여 무작위 벡터의 최대 절대값의 역수를 상한선으로 제한한다.
  • 고확률 하한선 $\Pr\left(\frac{1}{\max_i |\mathbf{A}_{i1}|} \geq k\right)$를 유도하며, 이는 BP 해의 $\ell_1$-노름 제어에 사용된다.
  • 이러한 확률적 한계를 설계 행렬의 구조와 결합하여, $p$에 따라 감소하는 비점근적이고 고확률적인 BP 모델 오차 상한선을 유도한다.

실험 결과

연구 질문

  • RQ1과다파라미터화된 영역에서 $p > n$ 인 경우 Basis Pursuit는 이중내림 일반화 오차 행동을 보이는가?
  • RQ2신호 강도 의존성과 내림구간 폭 측면에서 BP의 이중내림 곡선은 min-$\ell_2$-노름 해와 어떻게 비교되는가?
  • RQ3완벽한 학습 피팅에도 불구하고 $\ell_1$-노름 최소화를 통한 오버피팅이 낮은 일반화 오차를 초래할 수 있는가?
  • RQ4BP가 높은 확률로 낮은 모델 오차를 유지할 수 있는 $p$의 최대 범위(표본 수 $n$에 대한 상대적 크기)는 무엇인가?
  • RQ5고신호대역비(SNR) 조건에서도 BP의 이중내림 행동은 신호 강도에 독립적인가?

주요 결과

  • $p$가 $\exp(\Theta(n))$까지의 넓은 범위에서, Basis Pursuit의 모델 오차는 고확률적으로 $p$에 따라 감소하는 값으로 상한선이 존재한다.
  • BP의 이중내림 상한선는 min-$\ell_2$-노름 해와 달리 신호 강도에 영향을 받지 않으며, SNR에 의존하지 않는다.
  • 고신호대역비(SNR)와 스파스 모델 조건에서, BP의 내림구간은 min-$\ell_2$-노름 해보다 훨씬 낮고 넓다.
  • 이 분석은 BP 해의 $\ell_1$-노름에 대한 비점근적이고 고확률적인 하한선을 확립하며, 이는 $p$ 증가에 따라 감소함을 보여준다.
  • 조건 $p - s \leq e^{(n-1)/16}/n$ 하에, 해 벡터의 최대 절대값의 역수가 임계값 $k$를 초과할 확률은 $1 - 3/n$ 이상으로 하한선이 존재한다.
  • 유도된 상한선는 $p$가 $n$에 대해 지수적으로 증가하더라도 BP가 낮은 오차를 유지함을 보여주며, 이는 오버피팅 영역에서의 과다파라미터화에 대한 BP의 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.