Skip to main content
QUICK REVIEW

[논문 리뷰] Asymptotic Convergence in Online Learning with Unbounded Delays

Scott Garrabrant, Nate Soares|arXiv (Cornell University)|2016. 04. 18.
Advanced Bandit Algorithms Research참고 문헌 17인용 수 6
한 줄 요약

이 논문은 무한한 피드백 지연이 있는 온라인 학습을 위한 EvOp 알고리즘을 제안한다. 이 알고리즘은 예측자가 희박하고 독립적인 부분수열에서 평가됨으로써 베이즈 최적 예측에 수렴한다. 이러한 설정에서는 일관성과 평균 손실 수렴이 이론적으로 불가능하나, 전문가가 베이즈 최적 예측을 하는 어떤 부분수열에서도 EvOp는 점차적으로 최적 행동에 수렴하며, 매우 약한 수렴 한계만 제공한다.

ABSTRACT

We study the problem of predicting the results of computations that are too expensive to run, via the observation of the results of smaller computations. We model this as an online learning problem with delayed feedback, where the length of the delay is unbounded, which we study mainly in a stochastic setting. We show that in this setting, consistency is not possible in general, and that optimal forecasters might not have average regret going to zero. However, it is still possible to give algorithms that converge asymptotically to Bayes-optimal predictions, by evaluating forecasters on specific sparse independent subsequences of their predictions. We give an algorithm that does this, which converges asymptotically on good behavior, and give very weak bounds on how long it takes to converge. We then relate our results back to the problem of predicting large computations in a deterministic setting.

연구 동기 및 목표

  • 피드백 지연이 무한한 설정, 즉 피드백이 임의로 긴 간격 후에 도착하는 온라인 학습 문제를 다루기 위해.
  • 훈련 데이터가 더 작은 지연된 계산에서 온다는 조건에서 큰 계산을 예측하는 문제를 정식화하기 위해.
  • 이 설정에서는 표준 성능 지표인 일관성과 평균 손실 수렴이 부적절하다는 것을 보여주기 위해.
  • 전문가가 최적 예측을 하는 부분수열에서 점차적으로 베이즈 최적 예측에 수렴하는 알고리즘을 설계하기 위해.
  • 스토케스틱 결과를 알고리즘적 무작위성에 기반한 큰 계산의 결정론적 예측으로 연결하기 위해.

제안 방법

  • EvOp는 예측자들을 모든 예측에서 평가하는 것이 아니라, 성장 함수 g와의 복합 함수 h를 통해 선택된 희박하고 독립적인 예측 부분수열에서 평가한다.
  • 알고리즘은 예측자가 크게 다를 수 있는 후보 예측 지점들을 식별하기 위해 테스트 시퀀스 함수 testseq_n(j, z, m)을 사용한다.
  • 각 시점에서 예측자들 간의 최대 점수를 계산하고, 이를 임계값과 비교하여 수렴 여부를 판단한다.
  • 손실 함수의 강한 볼록성과-Lipschitz 연속성으로부터 유도된 지수 尾 꼬리 확률 바ounds를 사용하여 점수 이탈의 확률적 바ounds를 통해 수렴을 증명한다.
  • 이 방법은 독립성을 보장하고 지연된 피드백에 대한 과적합을 피하기 위해 희박한 부분수열 구조에 의존한다.
  • 수렴 시간에 대한 약한 바ounds는 점수 이탈 확률의 지수 감쇠에서 유도되며, 이는 점차 수렴을 보장하는 데 충분하다.

실험 결과

연구 질문

  • RQ1피드백 지연이 무한할 경우 온라인 학습 알고리즘이 일관성 또는 점차 감소하는 평균 손실을 달성할 수 있는가?
  • RQ2무한 지연이 존재하는 환경에서 베이즈 최적 예측에 점차 수렴하는 알고리즘을 설계할 수 있는가?
  • RQ3평균 손실이 0으로 수렴하지 않을 수 있는 상황에서, 무한 지연이 있는 온라인 학습에서 의미 있는 성능 지표는 무엇인가?
  • RQ4피드백이 무한히 지연될 경우, 의미 있고 독립적인 부분수열에서 예측자를 어떻게 식별하고 평가할 수 있는가?
  • RQ5스토케스틱 설정에서의 결과를 큰 계산의 결정론적 예측에 의미 있게 연결할 수 있는가?

주요 결과

  • 무한 지연이 있는 온라인 학습에서는 일반적으로 일관성과 평균 손실 수렴이 달성될 수 없다.
  • 최적의 예측자라도 평균 손실이 0으로 수렴하지 않을 수 있어, 이 설정에서는 표준 성능 지표가 무력화된다.
  • EvOp는 전문가가 베이즈 최적 예측을 하는 어떤 부분수열에서도 점차적으로 베이즈 최적 예측에 수렴한다.
  • 알고리즘은 지연된 피드백의 악영향을 피하기 위해 예측자의 희박하고 독립적인 부분수열에서 평가함으로써 수렴을 달성한다.
  • 수렴 바ounds는 매우 약한 편이지만, 점수 이탈의 지수 꼬리 바ounds에서 유도되었으며 여전히 점차 최적성을 보장하는 데 충분하다.
  • 이 프레임워크는 스토케스틱 모델에서 규칙적인 부분수열을 식별함으로써 큰 결정론적 계산을 예측하는 데 기초를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.