Skip to main content
QUICK REVIEW

[논문 리뷰] Proper Learning, Helly Number, and an Optimal SVM Bound

Olivier Bousquet, Steve Hanneke|arXiv (Cornell University)|2020. 05. 24.
Machine Learning and Algorithms참고 문헌 34인용 수 7
한 줄 요약

이 논문은 적절한 학습 알고리즘의 최적의 PAC 샘플 복잡도를 달성할 수 있는지 여부를 결정짓는 핵심 조합적 매개변수로 이중 헬리 수를 규명한다. 이는 일반적으로 경험이론적 리스크 최소화(ERM)에서 요구되는 로그 인자 없이도 가능하다. 이 논문은 유계 이중 헬리 수가 최적 샘플 복잡도를 달성하는 적절한 학습자가 존재하는 클래스를 특징짓는다고 증명하며, 실현 가능 설정에서 서포트 벡터 머신(SVM)에 대한 첫 번째 최적이고 계산적으로 효율적인 PAC 경계를 수립함으로써 오랫동안 남아있던 문제를 해결한다: $ Theta\left(\frac{n}{\varepsilon} + \frac{1}{\varepsilon}\log\frac{1}{\delta}\right)$.

ABSTRACT

The classical PAC sample complexity bounds are stated for any Empirical Risk Minimizer (ERM) and contain an extra logarithmic factor $\log(1/ε)$ which is known to be necessary for ERM in general. It has been recently shown by Hanneke (2016) that the optimal sample complexity of PAC learning for any VC class C is achieved by a particular improper learning algorithm, which outputs a specific majority-vote of hypotheses in C. This leaves the question of when this bound can be achieved by proper learning algorithms, which are restricted to always output a hypothesis from C. In this paper we aim to characterize the classes for which the optimal sample complexity can be achieved by a proper learning algorithm. We identify that these classes can be characterized by the dual Helly number, which is a combinatorial parameter that arises in discrete geometry and abstract convexity. In particular, under general conditions on C, we show that the dual Helly number is bounded if and only if there is a proper learner that obtains the optimal joint dependence on $ε$ and $δ$. As further implications of our techniques we resolve a long-standing open problem posed by Vapnik and Chervonenkis (1974) on the performance of the Support Vector Machine by proving that the sample complexity of SVM in the realizable case is $Θ((n/ε)+(1/ε)\log(1/δ))$, where $n$ is the dimension. This gives the first optimal PAC bound for Halfspaces achieved by a proper learning algorithm, and moreover is computationally efficient.

연구 동기 및 목표

  • 경험 이론적 리스크 최소화에서 일반적으로 요구되는 $\\log(1/\\varepsilon)$ 인자 없이도 최적의 PAC 샘플 복잡도를 달성하는 적절한 학습 알고리즘이 존재하는 개념 클래스를 특징짓는 것.
  • 이산 기하학에서 유래한 조합적 매개변수인 이중 헬리 수가 적절한 학습의 샘플 복잡도에 어떻게 영향을 미치는지 조사하는 것.
  • 실현 가능 설정 하에서 $\\mathbb{R}^n$ 내의 서포트 벡터 머신의 샘플 복잡도에 관한 오랫동안 남아있던 열린 문제를 해결하는 것.
  • 적절한 학습이 $\\varepsilon$에 대한 최적의 의존도를 달성할 수 있는 것은 이중 헬리 수가 유계일 때에만 성립한다는 것을 증명하는 것.

제안 방법

  • 저자들은 개념 클래스의 구조적 성질로 이중 헬리 수를 도입하고, 이와 최적 샘플 복잡도를 갖는 적절한 학습자가 존재하는 것과의 연관성을 분석한다.
  • 개념 클래스 $\\mathbb{C}$가 최적의 $\\varepsilon$-의존도를 갖는 적절한 학습자를 가질 수 있음이 이중 헬리 수가 유계일 때이고 그 때에만 성립함을 증명한다.
  • 이 분석은 조합적 조건이 적절한 학습이 $\\log(1/\\varepsilon)$ 페널티를 피할 수 있는지를 규명하기 위해 이산 기하학과 추상 볼록성의 도구를 활용한다.
  • 논문은 이 프레임워크를 $\\mathbb{R}^n$ 내의 반공간 클래스에 적용하여, 이 클래스에 대해 이중 헬리 수가 유계임을 보인다.
  • 이중 헬리 수 분석과 알려진 일반화 경계를 조합하여 실현 가능 설정에서 SVM의 샘플 복잡도를 유도한다.
  • 유도된 경계가 최적이며 계산적으로 효율적임을 보이며, 실현 가능 설정에서 적절한 학습의 새로운 기준을 설정한다.

실험 결과

연구 질문

  • RQ1어떤 조건에서 적절한 학습 알고리즘이 일반적으로 ERM에서 요구되는 $\\log(1/\\varepsilon)$ 인자 없이 최적의 PAC 샘플 복잡도를 달성할 수 있는가?
  • RQ2이중 헬리 수는 적절한 학습 알고리즘의 샘플 복잡도와 어떻게 관련이 있는가?
  • RQ3실현 가능 설정 하에서 $\\mathbb{R}^n$ 내의 서포트 벡터 머신의 정확한 샘플 복잡도는 무엇인가?
  • RQ4반공간 클래스에 대해 $\\mathbb{R}^n$ 내에서 최적의 샘플 복잡도를 달성할 수 있는 적절한 학습 알고리즘이 존재하는가?

주요 결과

  • 이중 헬리 수가 유계일 때이고 그 때에만 최적의 $\\varepsilon$-의존도를 갖는 샘플 복잡도를 달성하는 적절한 학습 알고리즘이 존재한다.
  • 실현 가능 설정에서 $\\mathbb{R}^n$ 내의 SVM 샘플 복잡도는 $\\Theta\left(\frac{n}{\\varepsilon} + \frac{1}{\\varepsilon}\log\frac{1}{\\delta}\right)$이며, 이는 최적이며 계산적으로 효율적이다.
  • 이 결과는 Vapnik(1974)가 제기한 실현 가능 설정에서 SVM 성능에 관한 오랫동안 남아있던 문제를 해결한다.
  • 이 결과는 적절한 학습 알고리즘에 의해 달성된 최초의 최적의 PAC 경계를 반공간 클래스에 대해 수립한다.
  • 이중 헬리 수는 적절한 학습이 비적절한 학습의 샘플 복잡도를 따라잡을 수 있는지 여부를 완전한 조합적 특징으로 제공한다.
  • 이 프레임워크는 광범위하게 적용 가능하며, 이중 헬리 수가 최적의 적절한 학습을 위해 필수적이고 충분한 조건임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.