Skip to main content
QUICK REVIEW

[논문 리뷰] Online Learning: Stochastic and Constrained Adversaries

Alexander Rakhlin, Karthik Sridharan|arXiv (Cornell University)|2011. 04. 27.
Advanced Bandit Algorithms Research참고 문헌 19인용 수 12
한 줄 요약

이 논문은 i.i.d. 스토케스틱 설정과 최악의 경우 적대적 설정 사이의 하이브리드 데이터 가정 하에서 온라인 학습을 위한 통합된 최소최대 프레임워크를 제안한다. 순차적 대칭화와 분포에 의존하는 라데마처 복잡도를 활용하여, 변형 유형의 리그레트 한계를 도출하고, i.i.d. 적대자 하에서 온라인 학습과 배치 학습의 등가성을 입증한다. 또한, 라이틀스타인 차원이 무한한 반평면은 스무딩 노이즈 하에서 학습 가능해짐을 보여준다.

ABSTRACT

Learning theory has largely focused on two main learning scenarios. The first is the classical statistical setting where instances are drawn i.i.d. from a fixed distribution and the second scenario is the online learning, completely adversarial scenario where adversary at every time step picks the worst instance to provide the learner with. It can be argued that in the real world neither of these assumptions are reasonable. It is therefore important to study problems with a range of assumptions on data. Unfortunately, theoretical results in this area are scarce, possibly due to absence of general tools for analysis. Focusing on the regret formulation, we define the minimax value of a game where the adversary is restricted in his moves. The framework captures stochastic and non-stochastic assumptions on data. Building on the sequential symmetrization approach, we define a notion of distribution-dependent Rademacher complexity for the spectrum of problems ranging from i.i.d. to worst-case. The bounds let us immediately deduce variation-type bounds. We then consider the i.i.d. adversary and show equivalence of online and batch learnability. In the supervised setting, we consider various hybrid assumptions on the way that x and y variables are chosen. Finally, we consider smoothed learning problems and show that half-spaces are online learnable in the smoothed model. In fact, exponentially small noise added to adversary's decisions turns this problem with infinite Littlestone's dimension into a learnable problem.

연구 동기 및 목표

  • i.i.d. 통계 학습과 최악의 경우 온라인 학습 사이의 격차를 메우기 위해 중간 데이터 가정을 분석함으로써 그 격차를 해소하고자 한다.
  • 제약된 적대자 하에서의 리그레트 최소화를 위한 일반적인 이론적 프레임워크를 개발하고자 한다. 이는 스토케스틱 및 스무딩 모델을 포함한다.
  • 적대자가 i.i.d. 데이터를 생성할 경우 온라인 학습과 배치 학습의 등가성을 입증하고자 한다.
  • 입력과 출력 변수가 서로 다른 가정 하에 생성되는 하이브리드 모델을 분석하고자 한다.
  • 반평면이 라이틀스타인 차원이 무한한 경우에도 스무딩 노이즈 하에서는 학습 가능해짐을 보여주고자 한다.

제안 방법

  • 적대자가 이동 집합에 제약을 받는 온라인 학습의 최소최대 공식화를 제안하여, i.i.d.에서 최악의 경우에 이르기까지의 스펙트럼 전반에서 분석이 가능하도록 한다.
  • 순차적 대칭화를 통해 유도된, 제약된 적대자와 함께하는 순차적 게임에 특화된 분포에 의존하는 라데마처 복잡도를 도입한다.
  • i.i.d. 라데마처 레이블을 사용한 확률적 과정 구축을 통해 게임의 최소최대 값을 하한으로 제시하고, 이를 라데마처 카오스 과정의 기대 상한과 연결한다.
  • 조건부 분포와 레이블 의존성의 구조를 분석함으로써 변형 유형의 리그레트 한계를 도출하기 위해 프레임워크를 적용한다.
  • 최소최대 리그레트가 유한한 조합 차원을 갖는 함수 클래스일 때와 오직 그 때에만 0으로 수렴함을 보여줌으로써, i.i.d. 데이터 하에서 온라인 학습과 배치 학습의 등가성을 입증한다.
  • 적대자 결정에 지수적으로 작은 노이즈를 추가함으로써(스무딩 모델) 반평면이 라이틀스타인 차원이 무한하더라도 온라인 학습 가능해짐을 보여준다.

실험 결과

연구 질문

  • RQ1i.i.d.와 최악의 경우 사이의 중간 데이터 가정을 분석할 수 있는 통합 프레임워크를 개발할 수 있는가?
  • RQ2적대자가 i.i.d. 데이터를 생성할 경우 온라인 학습과 배치 학습의 관계는 어떠한가?
  • RQ3입력과 출력이 서로 다른 가정 하에 생성되는 하이브리드 모델에서 최소최대 리그레트는 어떻게 행동하는가?
  • RQ4라데마처 복잡도 개념을 제약된 적대자와 함께하는 순차적 게임으로 확장할 수 있는가?
  • RQ5작은 노이즈를 추가함으로써(스무딩 모델) 이전에 학습이 불가능했던 문제들, 예를 들어 라이틀스타인 차원이 무한한 반평면은 온라인 설정에서 학습 가능해지는가?

주요 결과

  • i.i.d. 적대자 하에서 최소최대 리그레트는 함수 클래스가 유한한 조합 차원을 갖는 경우에만 0으로 수렴하며, 이는 고전적 통계 학습 결과와 일치한다.
  • 분포에 의존하는 라데마처 복잡도가 데이터 가정의 전 스펙트럼에 대해 정의되어 있으며, 이는 변형 유형의 리그레트 한계를 가능하게 한다.
  • i.i.d. 데이터 하에서 온라인 학습과 배치 학습의 등가성을 입증하여, 두 설정이 동일한 최소최대 리그레트 속도를 갖는다는 것을 보여준다.
  • 스무딩 모델 하에서 적대자가 지수적으로 작은 노이즈를 추가할 경우, 라이틀스타인 차원이 무한한 반평면도 온라인 학습 가능해진다.
  • 게임의 최소최대 값은 함수 클래스 위에서의 라데마처 과정의 기대 상한에 의해 하한으로 제시되며, 이는 i.i.d. 레이블 가정 하에서 분포에 의존하는 라데마처 복잡도와 동일하다는 것이 입증되었다.
  • 이 프레임워크는 최악의 경우, i.i.d., 스무딩 모델을 하나의 최소최대 분석으로 통합하여, 구조적 적대자와 함께하는 순차적 의사결정 문제를 분석하는 데 일반적인 도구를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.