Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating Learnability in the Sublinear Data Regime

Weihao Kong, Gregory Valiant|arXiv (Cornell University)|2018. 05. 04.
Machine Learning and Algorithms참고 문헌 57인용 수 4
한 줄 요약

이 논문은 데이터 차원에 비해 선형 함수에 의해 설명 가능한 레이블 분산의 비율을 추정할 수 있는 방법을 제안한다. 특히 데이터가 차원에 대해 비선형일 때도 가능하다. 등방성 케이스에서는 $O(\sqrt{d})$개의 샘플을, 비등방성 케이스에서는 $O(d^{1-1/\log(1/\epsilon)})$개의 샘플을 사용하여, 일致한 공분산 추정이 필요 없거나 레이블에 대한 강한 분포 가정이 없이도 정확한 노이즈 분산 추정을 달성한다.

ABSTRACT

We consider the problem of estimating how well a model class is capable of fitting a distribution of labeled data. We show that it is often possible to accurately estimate this "learnability" even when given an amount of data that is too small to reliably learn any accurate model. Our first result applies to the setting where the data is drawn from a $d$-dimensional distribution with isotropic covariance (or known covariance), and the label of each datapoint is an arbitrary noisy function of the datapoint. In this setting, we show that with $O(\sqrt{d})$ samples, one can accurately estimate the fraction of the variance of the label that can be explained via the best linear function of the data. In contrast to this sublinear sample size, finding an approximation of the best-fit linear function requires on the order of $d$ samples. Our sublinear sample results and approach also extend to the non-isotropic setting, where the data distribution has an (unknown) arbitrary covariance matrix: we show that, if the label $y$ of point $x$ is a linear function with independent noise, $y = \langle x , β angle + noise$ with $\|β\|$ bounded, the variance of the noise can be estimated to error $ε$ with $O(d^{1-1/\log{1/ε}})$ if the covariance matrix has bounded condition number, or $O(d^{1-\sqrtε})$ if there are no bounds on the condition number. We also establish that these sample complexities are optimal, to constant factors. Finally, we extend these techniques to the setting of binary classification, where we obtain analogous sample complexities for the problem of estimating the prediction error of the best linear classifier, in a natural model of binary labeled data. We demonstrate the practical viability of our approaches on several real and synthetic datasets.

연구 동기 및 목표

  • 데이터가 모델을 정확히 학습하기에 너무 부족할 때, 레이블 데이터의 분포에 대해 어떤 모델 클래스가 얼마나 잘 맞출 수 있는지 추정하는 것.
  • 기존 학습 방법이 $\Omega(d)$개의 샘플을 요구하는 한계를 극복하기 위해, $o(d)$개의 샘플로도 학습 가능성 추정이 가능함을 보이는 것.
  • 선형 레이블에 독립된 노이즈를 가정하지 않고도 비등방성 및 비정규 분포 데이터 분포로의 추정을 확장하는 것.
  • 분산 및 분류 오차 추정에 대한 샘플 복잡도와 최적성에 대한 이론적 보장을 제공하는 것.
  • 최소한의 분포 가정 하에 실제 및 시뮬레이션 데이터셋에서의 실용적 타당성을 입증하는 것.

제안 방법

  • 데이터 공분산이 알려지지 않았거나 임의일 때도 선형 함수에 의해 설명 가능한 레이블 분산의 비율을 통합적으로 추정하는 방법을 사용한다.
  • 고차원 구의 기하적 성질을 활용하여 카이제곱 발산과 총 변동 거리로 샘플 복잡도의 하한을 유도한다.
  • 가우스 레이블의 부호 변환을 사용하여 이진 분류 문제를 회귀 설정으로 랜덤화한 감소를 적용한다.
  • 단위 벡터 위에서의 각도 적분을 사용하여 순수 노이즈와 순수 신호의 분포 간 카이제곱 발산에 대한 경계를 유도한다.
  • 구적분에 대한 농도 및 尾部 경계를 사용하여 노이즈와 신호를 구별할 수 있는 능력을 상한으로 제시한다.
  • 정보 이론적 추론을 통해 최적성의 하한을 유도함으로써 샘플 복잡도의 최적성(상수 인자까지)을 확립한다.

실험 결과

연구 질문

  • RQ1데이터 차원 $d$가 주어졌을 때, $d$개 이하의 샘플로도 모델 클래스의 학습 가능성(예: 설명 가능한 분산)을 추정할 수 있는가?
  • RQ2등방성 데이터일 경우 $O(\sqrt{d})$개의 샘플로 선형 모델의 노이즈 분산을 추정할 수 있는가?
  • RQ3알 수 없는 공분산을 가진 비등방성 데이터로도 하위선형 학습 가능성 추정을 확장할 수 있으며, 그에 필요한 샘플 복잡도는 얼마인가?
  • RQ4로지스틱 모델 가정 하에 이진 분류 설정에서도 이 방법이 효과를 유지하는가?
  • RQ5학습 가능성 추정에 대한 유도된 샘플 복잡도는 상수 인자까지 최적인가?

주요 결과

  • 등방성 가우스 케이스에서는 $O(\sqrt{d})$개의 샘플로 최적 선형 함수에 의해 설명 가능한 레이블 분산의 비율을 정확하게 추정할 수 있다.
  • 유한한 조건수를 가진 비등방성 케이스에서는 $\epsilon$ 이내의 오차로 노이즈 분산을 $O(d^{1-1/\log(1/\epsilon)})$개의 샘플로 추정할 수 있다.
  • 조건수가 유한하지 않은 경우 필요한 샘플 수는 $O(d^{1-\sqrt{\epsilon}})$이며, 이러한 경계는 상수 인자까지 최적이다.
  • 로지스틱 모델 하에서 이진 분류로의 확장이 가능하며, 최적 선형 분류기의 오차를 추정하는 데에도 유사한 하위선형 샘플 복잡도를 달성한다.
  • 이론적 하한은 비등방성 케이스에서 $o(d)$개의 샘플로는 순수 노이즈와 신호를 구별할 수 없다는 것을 보여준다.
  • 이 방법은 임의의 레이블 분포에 대해 강건하며, 이전 연구와 달리 레이블이 선형 함수에 독립된 노이즈를 가진다는 가정이 필요 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.