Skip to main content
QUICK REVIEW

[論文レビュー] Post-Contextual-Bandit Inference

Aurélien Bibaut, Antoine Chambaz|PubMed|Jun 1, 2021
Advanced Bandit Algorithms Research参考文献 31被引用数 13
ひとこと要約

本稿では、適応的データ収集を行う文脈的バンディット設定において、漸近正規性の推論を可能にする最初の手法である文脈的適応的二重ロバスト(CADR)推定量を提案する。重要度サンプリング比から導出される適応的かつ一貫性のある条件付き分散推定量を用いて二重ロバスト推定量を安定化させることで、57個のOpenMLデータセットにおいて、従来の手法が失敗する状況でも有効な95%信頼区間を実現した。

ABSTRACT

Contextual bandit algorithms are increasingly replacing non-adaptive A/B tests in e-commerce, healthcare, and policymaking because they can both improve outcomes for study participants and increase the chance of identifying good or even best policies. To support credible inference on novel interventions at the end of the study, nonetheless, we still want to construct valid confidence intervals on average treatment effects, subgroup effects, or value of new policies. The adaptive nature of the data collected by contextual bandit algorithms, however, makes this difficult: standard estimators are no longer asymptotically normally distributed and classic confidence intervals fail to provide correct coverage. While this has been addressed in non-contextual settings by using stabilized estimators, the contextual setting poses unique challenges that we tackle for the first time in this paper. We propose the Contextual Adaptive Doubly Robust (CADR) estimator, the first estimator for policy value that is asymptotically normal under contextual adaptive data collection. The main technical challenge in constructing CADR is designing adaptive and consistent conditional standard deviation estimators for stabilization. Extensive numerical experiments using 57 OpenML datasets demonstrate that confidence intervals based on CADR uniquely provide correct coverage.

研究の動機と目的

  • 適応的データ収集によって標準的信頼区間が無効化される文脈的バンディット実験における有効な推論の欠如に対処すること。
  • 文脈依存の適応的データ収集下でも漸近正規性を達成する推定量を開発すること。
  • 現実世界の適応的実験における平均処置効果、サブグループ効果、または方策価値の信頼区間を、正しい被覆率で構築すること。
  • この文脈的設定において、二重ロバスト推定量を安定化させるために、一貫性があり適応的な条件付き分散推定量を設計する課題を克服すること。
  • 推定量の誤指定に対してもロバストでありながら、有効な推論を維持すること。

提案手法

  • 標準勾配の重み付き時系列平均としての文脈的適応的二重ロバスト(CADR)推定量を提案する。重みは推定された条件付き標準偏差の逆数で与えられる。
  • 各時刻における現在の方策と過去の方策との間の重要度サンプリング比を用いて、適応的条件付き分散推定量を設計する。
  • 適応的サンプリング下でも一貫性を保証するため、結果モデルに対してクロスフィットとプラグイン推定を採用する。
  • 二重ロバスト推定を用いることで、結果モデルが誤指定であっても漸近正規性を維持する。
  • 高分散領域における高次の逆プロバビリティスコアの影響を低減するため、分散安定化を適用する。
  • well-specifiedおよびmisspecifiedな結果モデルの両方で、57個のOpenMLデータセットを用いた広範な実験により、手法の有効性を検証した。

実験結果

リサーチクエスチョン

  • RQ1適応的かつ文脈依存的なデータ収集が行われる文脈的バンディット実験において、方策価値の有効な信頼区間を構築することは可能か?
  • RQ2文脈的適応的データ収集下でも、方策価値推定量が漸近正規性を達成することは可能か?
  • RQ3この設定において、二重ロバスト推定量を安定化させるために、一貫性があり適応的な条件付き分散推定量をどのように設計できるか?
  • RQ4結果モデルが誤指定されている場合でも、CADR推定量は正しい被覆率を維持するか?
  • RQ5多様な現実世界のデータセットにおいて、CADRはDR、IPW、DM、ADRといった既存の推定量と比べて、被覆率の正確性で優れているか?

主な発見

  • CADRは、57個のOpenMLデータセットすべてで正しい95%信頼区間の被覆率を達成したが、すべてのベースライン手法(DR、IPW、DM、ADR、MRDR)は有効な被覆率を維持できなかった。
  • 線形結果モデルが誤指定されている場合、CADRは72個のデータセットのうち38個でDRを顕著に上回り、分散安定化の面でも顕著な改善を示した。
  • 結果モデルがwell-specified(決定木を用いて)である場合、CADRとDRは同等の被覆率を示したが、CADRは多様なデータ分布に対してよりロバストであった。
  • 結果モデルの学習に重要度サンプリング重みを用いた訓練を行うCAMRDRという変種は、well-specifiedな状況ではCADRをわずかに上回り、misspecifiedな状況ではわずかに劣るが、依然としてすべてのベースラインを上回った。
  • CADR推定量の漸近正規性は、結果モデルの誤指定に対してもロバストであり、結果モデルが不正確であっても信頼できる推論を可能にする。
  • 広範な実験により、CADRはwell-specifiedおよびmisspecifiedな両方のモデルで一貫して正しい被覆率を維持する唯一の手法であることが確認され、文脈的バンディットデータにおける最初の有効な推論手法であることが確立された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。