Skip to main content
QUICK REVIEW

[논문 리뷰] An optimal unrestricted learning procedure

Shahar Mendelson|arXiv (Cornell University)|2017. 07. 17.
Machine Learning and Algorithms참고 문헌 18인용 수 4
한 줄 요약

이 논문은 임의의 함수 클래스, 분포, 목표 함수를 포함한 모든 학습 문제에 대해 가능한 한 최적의 표본 복잡도를 달성하는 비제약 학습 절차를 소개한다. 이는 비정규 분포나 무거운 尾 분포 설정에서도 성능을 발휘하며, 기존의 제약 학습 절차보다 우수하다. 특히 함수 클래스가 볼록일 경우 이는 제약 학습 절차로 축소되어 두 경우 모두 최소 최대 최적 속도를 달성한다.

ABSTRACT

We study learning problems involving arbitrary classes of functions $F$, distributions $X$ and targets $Y$. Because proper learning procedures, i.e., procedures that are only allowed to select functions in $F$, tend to perform poorly unless the problem satisfies some additional structural property (e.g., that $F$ is convex), we consider unrestricted learning procedures that are free to choose functions outside the given class. We present a new unrestricted procedure that is optimal in a very strong sense: the required sample complexity is essentially the best one can hope for, and the estimate holds for (almost) any problem, including heavy-tailed situations. Moreover, the sample complexity coincides with the what one would expect if $F$ were convex, even when $F$ is not. And if $F$ is convex, the procedure turns out to be proper. Thus, the unrestricted procedure is actually optimal in both realms, for convex classes as a proper procedure and for arbitrary classes as an unrestricted procedure.

연구 동기 및 목표

  • 함수 클래스의 볼록성과 같은 구조적 가정이 없는 경우 성능이 열 劣한 제약 학습 절차의 한계를 해결하기 위해.
  • 임의의 함수 클래스, 분포, 목표 함수에 대해 표본 복잡도가 최적화된 학습 절차를 개발하기 위해. 비볼록 및 무거운 尾 분포 설정도 포함한다.
  • 주어진 클래스 외부의 함수 선택이 가능한 비제약 절차를 사용하여 볼록 및 비볼록 클래스에서 최적의 성능을 통합하기 위해.
  • 모든 학습 문제에 대해 이론적 하한선과 정확히 일치하는 표본 복잡도 상한을 확립하기 위해, 절대 상수 이내로.
  • 함수 클래스가 볼록일 경우 이 절차가 제약 학습 방법으로 축소되며, 두 영역 모두에서 최적성을 달성함을 보여주기 위해.

제안 방법

  • 제약된 클래스 $ F $ 내부에만 함수를 선택하는 데 얽매이지 않는 비제약 학습 절차를 제안하여, 비볼록 설정에서 더 나은 일반화 성능을 달성한다.
  • 초과 위험의 세 구성 요소 분해를 사용한다: 승수 과정 $ b{M} $, 랜덤 과정 $ b{Q} $, 국소화 성분 $ b{P} $로, 각각 균일 제어 프레임워크 하에서 분석한다.
  • 최적 함수 $ f^* $ 주변의 초과 위험 국소화를 제어하기 위해 $ (r, u) $-필수 부분집합의 개념을 기반으로 한 기하학적 추론을 사용한다.
  • 지역화된 클래스 $ H_{f^*, r} $ 위에서 라데마처 카오스 과정의 최대값을 제어하기 위해 사슬 유형의 엔트로피 적분 상한을 적용하여 균일 농도를 확보한다.
  • 세 구성 요소 $ b{P}, b{Q}, b{M} $가 높은 확률 $ 1 - heta $ 에서 확률적 상한을 만족하도록 표본 크기 $ N $ 에 대한 조건을 설정하여 고확률 초과 위험 제어를 이룬다.
  • 기하학적 및 통계적 복잡도에 기반해 상수 $ u, heta_0, heta_1, heta_2, heta_3, heta_4 $ 를 校정함으로써 명시적 표본 복잡도 상한을 유도한다. 여기서 $ u riangleq 1/ ilde{ heta}_1^2 $ 이며, 이를 엔트로피와 라데마처 복잡도와 연결한다.

실험 결과

연구 질문

  • RQ1비볼록이거나 데이터 분포가 무거운 尾을 가진 경우에도 임의의 함수 클래스 $ F $ 에 대해 최적의 표본 복잡도를 달성할 수 있는 학습 절차가 존재하는가?
  • RQ2초과 위험 $ b{E}[ ext{초과 위험}] riangleq b{E}[( ilde{f}(X) - Y)^2] - b{E}[(f^*(X) - Y)^2] riangleq b{E}_p riangleq b{E}[ ext{초과 위험}] $ 가 고확률 $ 1 - ilde{ heta}_2 $ 에서 $ ilde{ heta}_1 $ 이하로 제한되도록 하기 위해 필요한 최소 표본 크기는 얼마인가?
  • RQ3어떻게 설계된 학습 절차가 볼록 클래스의 경우 제약 학습 방법으로 작동하고 일반 경우 비제약 학습 방법으로 작동함으로써 두 경우 모두 최적의 성능을 발휘할 수 있는가?
  • RQ4비볼록성과 같은 기하학적 장애물이 비제약 학습의 필요성을 결정짓는 데 어떤 역할을 하는가? 그리고 표본 복잡도 제어를 통해 이를 어떻게 극복할 수 있는가?
  • RQ5학습의 표본 복잡도가 클래스 $ F $ 의 구조적 성질에 독립적으로 상한을 둘 수 있는 정도는 어느 정도이며, 달성 가능한 가장 날카로운 상한은 무엇인가?

주요 결과

  • 제안된 비제약 학습 절차는 임의의 함수 클래스 $ F $ 에 대해 절대 상수 이내로 최적의 표본 복잡도를 달성하며, 비볼록일 경우에도 $ (F, X, Y) $ 를 포함한 모든 학습 문제에 대해 이론적 하한선과 정확히 일치한다.
  • 함수 클래스 $ F $ 가 비볼록일지라도, 이 절차의 표본 복잡도는 $ F $ 가 볼록일 경우 기대되는 바와 정확히 일치한다. 이는 비제약 접근이 구조적 가정의 필요성을 제거함을 보여준다.
  • 함수 클래스 $ F $ 가 볼록일 경우 이 절차는 제약 학습 방법으로 축소되며, 볼록 클래스에 대해 최소 최대 최적 속도를 달성한다. 따라서 두 설정 모두에서 최적이다.
  • 이 절차는 국소화된 클래스 $ H_{f^*, r} $ 의 엔트로피, 라데마처 복잡도, 목표 변수 $ Y $ 의 분산에만 의존하는 표본 크기 $ N $ 를 사용하여 고확률 $ 1 - ilde{ heta}_2 $ 에서 초과 위험을 제어한다.
  • 분석을 통해 필요한 표본 크기 $ N $ 가 $ b{E}[ ext{라데마처 과정의 최대값}] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] riangleq b{E}[ ext{sup}_u rac{1}{ ilde{ heta}_1} ilde{ heta}_2 ilde{ heta}_3 ilde{ heta}_4 ilde{ heta}_5 ilde{ heta}_6] $ 를 만족함을 보여주며, 이는 균일 농도를 보장한다.
  • 이 절차의 최적성은 초과 위험의 삼중 분해 $ b{P}, b{Q}, b{M} $ 를 통해 입증되며, 이 세 성분이 하나의 통합된 표본 복잡도 조건 하에서 고확률로 제어되며, 최종 초과 위험 상한은 $ b{E}_p riangleq b{E}[ ext{초과 위험}] riangleq b{E}[ ext{초과 위험}] riangleq b{E}[ ext{초과 위험}] $ 가 된다. 여기서 $ r' riangleq ilde{ heta}_1 r $ 이며, $ r riangleq ilde{ heta}_2 / ilde{ heta}_3^2 $ 이다. $ ilde{ heta}_1 riangleq ilde{ heta}_1 $, $ ilde{ heta}_2 riangleq ilde{ heta}_2 $, $ ilde{ heta}_3 riangleq ilde{ heta}_3 $, $ ilde{ heta}_4 riangleq ilde{ heta}_4 $, $ ilde{ heta}_5 riangleq ilde{ heta}_5 $, $ ilde{ heta}_6 riangleq ilde{ heta}_6 $.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.