Skip to main content
QUICK REVIEW

[논문 리뷰] Faster Rates for Policy Learning

Alexander R. Luedtke, Antoine Chambaz|arXiv (Cornell University)|2017. 04. 21.
Advanced Bandit Algorithms Research참고 문헌 14인용 수 7
한 줄 요약

이 논문은 일반적인 조건 하에서 최적 정책 학습에 대해 표준 n^{-1/2} 이하의 회귀 감소율을 초월하는 더 빠른 회귀 감소율을 확립한다. Donsker 클래스 위에서의 경험 위험 최소화자가 마진 조건 없이 제2차 회귀 감소율을 달성함을 보여주며, 마진 조건이 만족될 경우 플러그인 추정량이 ERM보다 더 빠른 속도를 달성할 수 있음을 입증한다. 이는 개인화 의료 및 컨텍스트 밴딧에 응용된다.

ABSTRACT

This article improves the existing proven rates of regret decay in optimal policy estimation. We give a margin-free result showing that the regret decay for estimating a within-class optimal policy is second-order for empirical risk minimizers over Donsker classes, with regret decaying at a faster rate than the standard error of an efficient estimator of the value of an optimal policy. We also give a result from the classification literature that shows that faster regret decay is possible via plug-in estimation provided a margin condition holds. Four examples are considered. In these examples, the regret is expressed in terms of either the mean value or the median value; the number of possible actions is either two or finitely many; and the sampling scheme is either independent and identically distributed or sequential, where the latter represents a contextual bandit sampling scheme.

연구 동기 및 목표

  • . 이 논문은 표준 n^{-1/2} 속도를 초월하여 최적 정책 추정에서의 회귀 감소율을 향상시키는 것을 목표로 한다.
  • . 제약이 있는 마진 가정에 의존하지 않고 더 빠른 속도가 가능할지 여부를 조사한다.
  • . 연구는 Donsker 클래스 내에서의 경험 위험 최소화(Empirical Risk Minimization, ERM)와 마진 조건 하에서의 플러그인 추정에 집중한다.
  • . 이 결과들은 개인화된 치료 규칙에 적용되며, i.i.d. 및 순차적(컨텍스트 밴딧) 샘플링 기반으로 이루어진다.
  • . 더 빠른 회귀 수렴이 가능한 일반적인 조건을 확립하는 것이 목적이다.

제안 방법

  • . Donsker 클래스 위에서의 경험 위험 최소화(ERM)를 사용하여 최적 정책를 추정한다.
  • . P-Donsker 클래스 내에서의 균일 수렴과 연속성 추론을 통해 회귀 감소율을 확립한다.
  • . 정책 학습을 분류 이론과 연결하여, 마진 조건을 활용해 더 빠른 속도를 유도한다.
  • . 정책 차이에 의한 가치 함수 차이의 안정성을 보장하기 위해 정책의 리프시츠 연속 변환을 도입한다.
  • . 증명은 경험 과정의 균일 연속성과 조건부 밀도의 유계성에 기반한다.
  • . 경험 과정 이론과 기능적 델타 방법을 사용하여 회귀를 경험 과정 노름의 관점에서 유계한다.

실험 결과

연구 질문

  • RQ1. 마진 가정 없이도 정책 학습에서 n^{-1/2}을 초월하는 더 빠른 회귀 감소율을 확립할 수 있는가?
  • RQ2. Donsker 클래스 위에서의 경험 위험 최소화가 제2차 회귀 감소율을 유도하는가?
  • RQ3. 플러그인 추정량이 ERM보다 더 빠른 회귀 감소율을 달성할 수 있는 조건은 무엇인가?
  • RQ4. 마진 조건은 정책 학습에서 회귀 감소율에 어떤 영향을 미치는가?
  • RQ5. 다양한 샘플링 체계 하에서 정책 가치 연속성과 회귀 감소율 간의 관계는 어떠한가?

주요 결과

  • . Donsker 클래스 위에서의 경험 위험 최소화자에 대한 회귀는 제2차 속도로 감소하며, 효율 추정기의 표준 오차를 초월한다.
  • . 논문은 마진 조건을 요구하지 않더라도 회귀 감소율이 n^{-1/2}을 초월할 수 있음을 입증한다.
  • . 마진 조건이 만족될 경우, 플러그인 추정량은 ERM보다 더 빠른 회귀 감소율을 달성한다.
  • . 정책 간 가치 함수 차이는 정책 차이의 L2(P)-노름으로 유계지며, 안정성을 보장한다.
  • . 마진 조건과 유계 밀도 가정 하에서, π ↦ ˙Fπ(V(π))의 사상은 균일 연속적이다.
  • . 결과는 i.i.d. 및 순차적(컨텍스트 밴딧) 샘플링 체계 모두에 대해 성립하며, 개인화 의료에의 응용이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.