Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Robust Linear Regression in Nearly Linear Time

Yeshwanth Cherapanamjeri, Efe Aras|arXiv (Cornell University)|2020. 07. 16.
Machine Learning and Algorithms참고 문헌 29인용 수 13
한 줄 요약

이 논문은 볼록 쌍대성과 준정형계획법(SDP) 근사화를 활용하여 최적의 강건한 선형 회귀를 위한 거의 선형 시간 알고리즘을 제시한다. 무거운 尾 분포 하에서 이차 형식의 가중합에 대한 고확률 경계를 수립하며, 새로운 가우시안 라운딩 기법을 통해 질량 1의 행렬과 일반적인 양의 준정형 행렬을 다룰 수 있음을 증명한다. 이로 인해 강건한 추정에서 최적의 표본 복잡도 ~O(d/η)를 확보하는 데 핵심이 되는 일정한 분산 경계를 달성한다.

ABSTRACT

We study the problem of high-dimensional robust linear regression where a learner is given access to $n$ samples from the generative model $Y = \langle X,w^* angle + ε$ (with $X \in \mathbb{R}^d$ and $ε$ independent), in which an $η$ fraction of the samples have been adversarially corrupted. We propose estimators for this problem under two settings: (i) $X$ is L4-L2 hypercontractive, $\mathbb{E} [XX^ op]$ has bounded condition number and $ε$ has bounded variance and (ii) $X$ is sub-Gaussian with identity second moment and $ε$ is sub-Gaussian. In both settings, our estimators: (a) Achieve optimal sample complexities and recovery guarantees up to log factors and (b) Run in near linear time ($ ilde{O}(nd / η^6)$). Prior to our work, polynomial time algorithms achieving near optimal sample complexities were only known in the setting where $X$ is Gaussian with identity covariance and $ε$ is Gaussian, and no linear time estimators were known for robust linear regression in any setting. Our estimators and their analysis leverage recent developments in the construction of faster algorithms for robust mean estimation to improve runtimes, and refined concentration of measure arguments alongside Gaussian rounding techniques to improve statistical sample complexities.

연구 동기 및 목표

  • 무거운 尾 분포 하에서 계산적으로 효율적인 최적의 강건한 선형 회귀 알고리즘을 개발하기 위해.
  • 고차원 회귀에서 통계적 강건성과 계산 효율성 간 격차를 메우기 위해.
  • 새로운 라운딩 기법을 사용하여 질량 1 행렬 분석을 일반적인 양의 준정형 행렬으로 확장하기 위해.
  • 강건한 추정에서 고확률적으로 최적의 표본 복잡도 ~O(d/η)를 달성하기 위해.
  • 그리드 근사와 유니언 바운드를 사용하여 모든 단위 벡터와 정규화된 양의 준정형 행렬에 대한 균일한 농도 경계를 제공하기 위해.

제안 방법

  • 최적의 해가 질량 1 행렬에 위치하더라도, 볼록 쌍대성을 적용하기 위해 강건한 회귀 문제를 준정형계획형식(SDP)으로 올리기.
  • 단위 벡터 (u,v)에 대한 미세한 격자로 근사 오차를 균일하게 제어하고 격자 위에서 유니언 바운드 적용하기.
  • 질량 1 행렬 M = vv⊤인 경우, u와 v와 강하게 상관관계가 있는 항을 피하기 위해 가중치 αi를 구성하여 합의 유한성 확보하기.
  • Tr(M) = 1 인 일반적인 정규화된 양의 준정형 행렬 M에 대해 결과를 일반화하기 위해 가우시안 라운딩 기법 도입하기.
  • 모든 단위 벡터 u와 행렬 M에 대해 ⟨Xi, u⟩²⟨XiXi⊤, M⟩과 지표 함수에 대한 균일한 농도 경계 수립하기. 이는 동시에 |⟨Xi, u⟩| ≤ 40/η 이며 ⟨XiXi⊤, M⟩ ≤ 400²/η 인 사건을 고려한다.
  • 두 단계 샘플링 전략 사용: 첫 번째로, 비영인 항에 큰 손실 없이 상관관계가 높은 항을 제거하고, 두 번째로 나머지 항들에 대해 중첩을 통제하면서 집중하기.

실험 결과

연구 질문

  • RQ1무거운 尾 분포 하에서 최적의 통계적 보장을 유지하면서 거의 선형 시간 내에 강건한 선형 회귀를 계산할 수 있는가?
  • RQ2최적의 해가 낮은 질량 부분공간에 위치함에도 불구하고, SDP로 올린 상태에서 볼록 쌍대성이 어떻게 적용될 수 있는가?
  • RQ3강건한 회귀에서 모든 단위 벡터와 양의 준정형 행렬에 대해 균일한 농도 경계를 확보하기 위해 필요한 최소 표본 복잡도는 무엇인가?
  • RQ4가우시안 라운딩 기법을 일반화하여 임의의 양의 준정형 행렬 M 방향에서 일정한 분산 경계를 확보할 수 있는가, 혹은 O(1/η²) 경계로만 제한되는가?
  • RQ5지수적 비용 증가 없이, 그리드 근사와 유니언 바운드를 사용하여 모든 (u, M) 쌍에 대한 균일한 경계를 어떻게 확보할 수 있는가?

주요 결과

  • 가정된 조건을 만족하는 분포 D에서 n = ~O(d/η)개의 표본을 취할 경우, |⟨Xi, u⟩|, |⟨Xi, v⟩| ≤ 800/η 영역에서 ⟨Xi, u⟩²⟨Xi, v⟩²의 기대합은 절대 상수 C4 이하로 유 bounds된다.
  • |⟨Xi, u⟩| ≤ 40/η 이고 |⟨Xi, v⟩| ≤ 40/η 를 만족하는 표본 비율은 고확률적으로 1 - η/100 이상이다.
  • 가중합의 경계는 Tr(M) = 1 인 일반적인 정규화된 양의 준정형 행렬 M로 확장되며, E[n][⟨Xi, u⟩²⟨XiXi⊤, M⟩1{...}] ≤ C6 를 만족하는 절대 상수 C6 가 존재한다.
  • |⟨Xi, u⟩| ≤ 40/η 이고 ⟨XiXi⊤, M⟩ ≤ 400²/η 인 사건의 지표 함수 기대값은 1 - η/25 이상이다.
  • 가우시안 라운딩 기법은 이전 결과를 일반화하여 O(1/η²) 대신 일정한 분산 경계를 달성함으로써, M 방향에서의 엄밀한 제어를 가능하게 한다.
  • 최종 결과로, 강건한 선형 회귀 추정기는 고차원에서 고확률적으로 최적의 표본 복잡도와 통계적 효율성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.