Skip to main content
QUICK REVIEW

[논문 리뷰] Conformal Off-Policy Prediction in Contextual Bandits

Muhammad Faaiz Taufiq, Jean-François Ton|arXiv (Cornell University)|2022. 06. 09.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 관찰 데이터를 사용하여 목표 정책 하에서 문맥 밴디트의 결과에 대해 유한 표본 유효 예측 구간을 구성하는 데 새로운 방법인 공식적 비정책 예측(COPP)을 제안한다. COPP는 공식적 예측을 활용하여 조건부 가변성에 적응하고 분포에 종속되지 않는 예측 구간을 제공하며, 보편적인 커버리지 보장을 갖추고 있어 기존 방법들보다 합성 및 실제 데이터 기반 벤치마크에서 커버리지 정확도와 구간 너비 측면에서 뛰어나다.

ABSTRACT

Most off-policy evaluation methods for contextual bandits have focused on the expected outcome of a policy, which is estimated via methods that at best provide only asymptotic guarantees. However, in many applications, the expectation may not be the best measure of performance as it does not capture the variability of the outcome. In addition, particularly in safety-critical settings, stronger guarantees than asymptotic correctness may be required. To address these limitations, we consider a novel application of conformal prediction to contextual bandits. Given data collected under a behavioral policy, we propose \emph{conformal off-policy prediction} (COPP), which can output reliable predictive intervals for the outcome under a new target policy. We provide theoretical finite-sample guarantees without making any additional assumptions beyond the standard contextual bandit setup, and empirically demonstrate the utility of COPP compared with existing methods on synthetic and real-world data.

연구 동기 및 목표

  • 기존의 비정책 평가 방법이 예측된 결과에만 초점을 맞추고 유한 표본 유효성이 결여되어 있는 점을 해결하기 위해.
  • 작은 표본 또는 위험 민감한 설정에서 결과의 변동성을 잘 반영하는 신뢰할 수 있는 예측 구간을 제공하기 위해.
  • 기존 접근 방식에서 흔히 발생하는 지나치게 보수적인 구간을 피하기 위해, 공변수 $X$에 따라 적응하는 커버리지 보장을 확보하기 위해.
  • 공식적 예측을 문맥 밴디트 설정에서 확률적 정책과 연속적인 행동 공간으로 확장하기 위해.
  • COPP가 목표 커버리지 수준을 유지하면서도 경쟁 방법들보다 더 좁은 구간을 생성하는 것으로 실증적으로 검증하기 위해.

제안 방법

  • COPP는 비정책 결과 예측에 공식적 예측을 적용하여, 사전에 지정된 확률로 진짜 결과 $Y$를 포함하는 예측 집합 $\hat{C}(x)$를 구성한다.
  • 행동 정책 $\pi^b$ 하에서 관측된 데이터를 재가중하기 위해 역확률 가중법을 사용하여 목표 정책 $\pi^*$ 하에서 결과의 분포를 추정한다.
  • 추정된 조건부 확률 $\hat{P}^{\pi^b}(y|x)$를 바탕으로 점수 함수 $s(x,y)$를 정의하여 공식적 예측을 위한 결과의 순위를 매긴다.
  • 교정 집합에서 점수의 경험적 분포의 $1-\alpha$ 분위수까지 가장 낮은 점수를 가진 결과들을 포함하여 예측 집합을 형성한다.
  • 이산 결과의 경우, 격자 기반 근사 없이 결과 공간 $\mathcal{Y}$ 위에서 직접 분위수를 계산한다.
  • 이 방법은 유한 표본의 보편적 커버리지 보장을 보장한다: $\mathbb{P}(Y \in \hat{C}(X)) \geq 1 - \alpha - o(n^{-1})$, 미약한 정규성 조건 하에 渐近적 조건부 커버리지가 성립한다.

실험 결과

연구 질문

  • RQ1공식적 예측이 비정책 결과에 대해 유한 표본, 조건부 가변성 있는 예측 구간을 제공하도록 어떻게 적응시킬 수 있는가?
  • RQ2WIS와 SBA와 같은 기존 비정책 평가 방법들과 비교해 볼 때 COPP의 커버리지 성능은 정확도와 구간 너비 측면에서 어떻게 다른가?
  • RQ3COPP는 정책 이동 정도나 이질적인 데이터 분포가 다양할 경우에도 신뢰할 수 있는 커버리지를 유지하는가?
  • RQ4COPP가 渐近적 조건부 커버리지에 도달하는 조건은 무엇이며, 이는 모델 오특사에 어떻게 관련되는가?
  • RQ5이산 결과 설정에서 레이블 조건부 커버리지 보장을 달성할 수 있는가?

주요 결과

  • COPP는 모든 테스트된 목표 정책에서 명목상 $90\%$ 수준에 매우 가까운 커버리지 수준을 달성하는 반면, WIS와 SBA는 정책 이동이 클수록 점점 더 보수적인 경향을 보였다.
  • 교정 포인트 수 $n = 5000$ 실험에서 COPP는 평균 $90.1\%$의 커버리지 수준을 유지하였으며, 이는 WIS($94.3\%$)와 SBA($95.1\%$)보다 목표 수준에 훨씬 가까웠다.
  • 특히 이산 결과 설정에서 WIS는 $X$에 대한 적응성이 없어 모든 레이블을 포함하는 경우가 많지만, COPP는 더 좁은 예측 구간을 생성하였다.
  • 이 방법은 정책 이동과 이방산성에 대해 강건하며, 비적응적 방법에서 흔히 나타나는 과도한 보수성 방지에 성공하였다.
  • 레이블 균형 잡힌 공식적 예측을 통해 레이블 조건부 커버리지가 달성되었으며, 실증 결과로 각 레이블에 대해 $\geq 90\%$의 조건부 커버리지가 확인되었고, 이는 표준 COPP가 이러한 제약 조건 하에서 실패할 수 있음을 고려할 때 뚜렷한 이점이었다.
  • 실증 결과는 COPP의 커버리지가 교정 데이터 크기가 증가함에 따라 향상되고 목표 수준으로 수렴하는 것으로 확인되었으며, 경쟁 방법들은 여전히 과도하게 보수적인 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.