[논문 리뷰] The Implicit Regularization of Ordinary Least Squares Ensembles
이 논문은 특징과 예제의 무작위 부분집합을 사용해 훈련된 일반 최소 제곱법(OLS) 예측기의 앙상블이 가우시안 가정 하에서 리지 회귀와 유사한 암묵적 정규화를 나타냄을 보여준다. 특징 부분집합 선택을 최적화할 경우, 앙상블의 점근적 위험은 최적의 리지 회귀 위험과 일치하며, 이는 딥 러닝의 드롭아웃과 유사한, 부분집합 선택에 기인한 숨겨진 정규화 효과를 드러낸다.
Ensemble methods that average over a collection of independent predictors that are each limited to a subsampling of both the examples and features of the training data command a significant presence in machine learning, such as the ever-popular random forest, yet the nature of the subsampling effect, particularly of the features, is not well understood. We study the case of an ensemble of linear predictors, where each individual predictor is fit using ordinary least squares on a random submatrix of the data matrix. We show that, under standard Gaussianity assumptions, when the number of features selected for each predictor is optimally tuned, the asymptotic risk of a large ensemble is equal to the asymptotic ridge regression risk, which is known to be optimal among linear predictors in this setting. In addition to eliciting this implicit regularization that results from subsampling, we also connect this ensemble to the dropout technique used in training deep (neural) networks, another strategy that has been shown to have a ridge-like regularizing effect.
연구 동기 및 목표
- 특징과 예제의 부분집합 선택이 OLS 기반 앙상블 방법에 미치는 암묵적 정규화 효과를 이해하기 위해.
- 이러한 앙상블이 선형 예측기 중에서 최적으로 알려진 리지 회귀와 유사한 성능을 달성할 수 있는지 확인하기 위해.
- OLS 앙상블과 딥 러닝에서의 드롭아웃 간의 이론적 연결을 수립하기 위해, 둘 다 리지 유사 정규화를 나타냄을 보여주기 위해.
- 고차원 점근적 절차에서 부분집합 선택 매개변수의 함수로서 앙상블의 점근적 위험을 기술하기 위해.
제안 방법
- 저자들은 전체 데이터 행렬 X ∈ ℝⁿˣᵖ 와 목표 벡터 y ∈ ℝⁿ 에서 무작위로 선택된 예제와 특징의 부분집합을 사용해 훈련된 k개의 독립적인 OLS 예측기의 앙상블을 연구한다.
- 각 예측기는 무작위로 행(예제)과 열(특징)을 선택한 부분행렬에 대해 일반 최소 제곱법을 사용하며, 최종 예측은 모든 k개의 예측기의 평균이다.
- 특징과 모델 가중치에 대해 i.i.d. 가우시안 가정을 두고, n, p → ∞ 의 한계에서 앙상블의 점근적 위험을 유도한다.
- 랜덤 행렬 이론과 의사역행렬의 성질을 활용하여 기대 위험을 계산하고, 리지 회귀 위험으로의 수렴을 보여준다.
- 확률적 경사 하강법을 통해 드롭아웃과의 연결을 확립하여, 앙상블의 행동이 드롭아웃 정규화로 훈련하는 것과 동일하다는 것을 보여준다.
- 핵심 수학적 도구로는 영공간에 대한 투영 연산자와 무작위 샘플링 행렬에 대한 기대값의 사용이 포함된다.
실험 결과
연구 질문
- RQ1OLS 앙상블에서의 특징 부분집합 선택이 리지 회귀 성능과 일치하는 암묵적 정규화를 유도하는가?
- RQ2OLS 앙상블의 점근적 위험은 각 예측기에서 선택된 특징 수와 예제 수에 따라 어떻게 달라지는가?
- RQ3앙상블의 행동을 딥 네URAL 네트워크에서의 드롭아웃 정규화와 공식적으로 연결할 수 있는가?
- RQ4동일한 데이터 가정 하에서 OLS 앙상블의 최적 위험은 최적의 리지 회귀 위험과 동일한가?
주요 결과
- 각 예측기에서 선택된 특징 수를 최적화할 경우, OLS 앙상블의 점근적 위험은 최적의 점근적 리지 회귀 위험과 동일하다.
- 점근적 위험은 예제 부분집합 선택의 정도와는 무관하며, 특징 부분집합 선택의 정도에만 의존한다. 이는 각 OLS 문제의 과소정의 조건이 유지될 경우에 한한다.
- 개별 OLS 예측기는 정규화되지 않았지만, 앙상블은 리지 회귀와 유사하게 암묵적으로 정규화된다.
- i.i.d. 가우시안 가정 하에서 고차원 한계 n, p → ∞ 에서 앙상블의 이론적 위험은 리지 회귀와 정확히 일치한다.
- OLS 앙상블과 드롭아웃 간의 공식적인 연결이 수립되었으며, 둘 다 무작위 부분집합 선택을 통해 리지 유사 정규화를 유도한다.
- 지정된 점근적 절차 하에서 예측기 수 k가 증가함에 따라 앙상블의 위험은 최적의 위험으로 수렴한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.