Skip to main content
QUICK REVIEW

[논문 리뷰] Imitation-Regularized Offline Learning

Yifei Ma, Yu-Xiang Wang|arXiv (Cornell University)|2019. 01. 15.
Advanced Bandit Algorithms Research참고 문헌 32인용 수 5
한 줄 요약

이 논문은 문맥적 밴디트에서 오프라인 정책 평가 및 최적화를 향상시키기 위해 정책 향상(PIL)과 정책 모방(IML)을 결합한 Imitation-Regularized Offline Learning(PIL-IML)을 제안한다. 보상 가중 교차 엔트로피 손실을 사용하고 IML을 분산 감소 및 자연 정책 기울기와 연결함으로써, 기록된 행동 확률이 없더라도 강력한 성능을 달성하며, Criteo와 같은 실세계 데이터셋에서 표준 IPWE 및 최신 기준 방법보다 뛰어나다.

ABSTRACT

We study the problem of offline learning in automated decision systems under the contextual bandits model. We are given logged historical data consisting of contexts, (randomized) actions, and (nonnegative) rewards. A common goal is to evaluate what would happen if different actions were taken in the same contexts, so as to optimize the action policies accordingly. The typical approach to this problem, inverse probability weighted estimation (IPWE) [Bottou et al., 2013], requires logged action probabilities, which may be missing in practice due to engineering complications. Even when available, small action probabilities cause large uncertainty in IPWE, rendering the corresponding results insignificant. To solve both problems, we show how one can use policy improvement (PIL) objectives, regularized by policy imitation (IML). We motivate and analyze PIL as an extension to Clipped-IPWE, by showing that both are lower-bound surrogates to the vanilla IPWE. We also formally connect IML to IPWE variance estimation [Swaminathan and Joachims 2015] and natural policy gradients. Without probability logging, our PIL-IML interpretations justify and improve, by reward-weighting, the state-of-art cross-entropy (CE) loss that predicts the action items among all action candidates available in the same contexts. With probability logging, our main theoretical contribution connects IML-underfitting to the existence of either confounding variables or model misspecification. We show the value and accuracy of our insights by simulations based on Simpson's paradox, standard UCI multiclass-to-bandit conversions and on the Criteo counterfactual analysis challenge dataset.

연구 동기 및 목표

  • 행동 확률이 누락되거나 희귀한 경우 오프라인 정책 학습에서 역확률가중추정(IPWE)의 높은 분산과 불안정성을 해결하기 위해.
  • 기록된 행동 확률이 가용하지 않은 실용적 제약 조건이 존재하는 환경에서도 효과적으로 작동하는 방법을 개발하기 위해.
  • 정책 모방(IML)을 IPWE의 분산 감소 및 자연 정책 기울기와 공식적으로 연결하여, 안정적인 대체 기준으로서의 사용을 정당화하기 위해.
  • 보상 가중 교차 엔트로피 손실이 정책 기울기 목표와 동일한 것으로, 보상 모델링이 없는 경우 Q-학습의 강력한 대안을 제공함을 보여주기 위해.
  • 합성 데이터, UCI 다중분류-밴디트 변환, Criteo 반사적 분석 챌린지 데이터셋에서 방법을 검증하기 위해.

제안 방법

  • 보상 가중 교차 엔트로피 손실을 사용하여 행동 선택을 최적화하는 정책 향상(PIL)과 정책 모방(IML)을 조합한 PIL-IML를 제안한다.
  • PIL과 클리핑된 IPWE가 모두 일반 IPWE의 하한 근사치임을 입증하여 이들의 사용에 대한 이론적 근거를 제공한다.
  • IML과 IPWE의 분산 추정 간의 관계를 유도하여, IML의 과소적합은 혼동 변수 또는 모델 오Specification을 시사함을 보여준다.
  • 로그 분리 가능성과 테일러 근사법을 활용하여 IML을 자연 정책 기울기와 연결함으로써 기존 강화학습 이론에 기반을 두게 한다.
  • 특히 무거운 尾 분포를 띠는 중요도 가중치에 대해 안정성을 확보하기 위해 가중치 클리핑과 갭 플러그 기법을 적용한다.
  • Criteo 데이터셋에서 성능을 평가하기 위해 부트스트랩 신뢰구간과 대응 가설 검정을 사용하여 IPWE, POEM, 그리고 탐욕 정책과 비교한다.

실험 결과

연구 질문

  • RQ1행동 확률이 누락된 경우 정책 모방(IML)이 분산 감소를 위한 안정적인 대체 기준으로서 역할할 수 있는가?
  • RQ2IML은 IPWE의 분산 추정과 강화학습의 자연 정책 기울기와 어떻게 관련이 있는가?
  • RQ3보상 가중 교차 엔트로피 손실이 정책 기울기 목표와 동일한 것으로, 보상 모델링이 없는 경우 Q-학습의 강력한 대안이 될 수 있는가?
  • RQ4IML 과소적합을 통해 오프라인 학습에서 혼동 변수나 모델 오Specification을 탐지할 수 있는가?
  • RQ5실세계 데이터에서 POEM 및 IPWE와 같은 최신 기준 방법과 비교할 때 PIL-IML는 추정 정확도와 안정성 측면에서 어떻게 성능을 내는가?

주요 결과

  • Criteo 반사적 분석 데이터셋에서 PIL-IML는 오프라인 추정에 대해 95% 신뢰구간 (52.3, 53.7) ×10⁴를 기록했으며, IPWE(51.9, 54.5) ×10⁴와 POEM(51.4, 53.7) ×10⁴를 모두 앞섰다.
  • PIL-IML에서 유도된 탐욕 정책는 (53.1, 55.2) ×10⁴의 성능을 기록하여 실현 가능한 IML 기준보다 뛰어나며, 보상 무관 탐욕 정책도 거의 최적에 가까운 성능을 낼 수 있음을 보여주었다.
  • IML 과소적합은 혼동 변수나 모델 오Specification을 탐지하기 위한 필수 조건이지만, 충분 조건은 아님을 발견했다.
  • 특히 최대 중요도 가중치가 49,000에 이르는 무거운 꼬리 분포에서 IML 정규화를 통해 IPWE 추정의 분산을 감소시켜 효과적으로 개선했다.
  • 행동 확률 누락 상황에서도 PIL-IML는 행동 확률이 제공될 경우 IPWE와 유사한 성능을 보였으며, 혼동이 존재하는 경우 Q-학습 기반 접근보다 뛰어난 성능을 보였다.
  • 가중치 클리핑과 갭 플러그 기법을 사용함으로써 안정성이 향상되었으며, 특히 글로벌 클릭률 약 5%의 낮은 클릭률 환경에서 상한선 과대추정 문제를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.