Skip to main content
QUICK REVIEW

[論文レビュー] Imitation-Regularized Offline Learning

Yifei Ma, Yu-Xiang Wang|arXiv (Cornell University)|Jan 15, 2019
Advanced Bandit Algorithms Research参考文献 32被引用数 5
ひとこと要約

本稿では、文脈バンディットにおけるオフライン方策評価および最適化を改善するため、方策改善(PIL)と方策模倣(IML)を組み合わせた、イミュレーション正則化付きオフライン学習(PIL-IML)を提案する。報酬重み付き交差エントロピー損失を用い、IMLを分散低減および自然方策勾配と結びつけることで、ログされた行動確率が存在しない状況でも頑健な性能を達成し、Criteo などの実世界データセットにおいて、標準的な IPWE や最先端のベースラインを上回る。

ABSTRACT

We study the problem of offline learning in automated decision systems under the contextual bandits model. We are given logged historical data consisting of contexts, (randomized) actions, and (nonnegative) rewards. A common goal is to evaluate what would happen if different actions were taken in the same contexts, so as to optimize the action policies accordingly. The typical approach to this problem, inverse probability weighted estimation (IPWE) [Bottou et al., 2013], requires logged action probabilities, which may be missing in practice due to engineering complications. Even when available, small action probabilities cause large uncertainty in IPWE, rendering the corresponding results insignificant. To solve both problems, we show how one can use policy improvement (PIL) objectives, regularized by policy imitation (IML). We motivate and analyze PIL as an extension to Clipped-IPWE, by showing that both are lower-bound surrogates to the vanilla IPWE. We also formally connect IML to IPWE variance estimation [Swaminathan and Joachims 2015] and natural policy gradients. Without probability logging, our PIL-IML interpretations justify and improve, by reward-weighting, the state-of-art cross-entropy (CE) loss that predicts the action items among all action candidates available in the same contexts. With probability logging, our main theoretical contribution connects IML-underfitting to the existence of either confounding variables or model misspecification. We show the value and accuracy of our insights by simulations based on Simpson's paradox, standard UCI multiclass-to-bandit conversions and on the Criteo counterfactual analysis challenge dataset.

研究の動機と目的

  • 行動確率が欠落または希少な場合に、オフライン方策学習における逆確率重み付け推定(IPWE)の高い分散と不安定性に対処すること。
  • ログされた行動確率が利用可能でない状況でも効果を発揮する手法を開発すること、これは実世界システムにおける一般的な実用的制限である。
  • 方策模倣(IML)を IPWE の分散低減および自然方策勾配と正式に結びつけることにより、安定な代替指標としての使用を正当化すること。
  • 報酬重み付き交差エントロピー損失(Q学習の代替として等価な方策勾配の目的関数に相当)が、報酬モデルなしの状況においても、Q学習に代わる頑健な代替手段を提供することを示すこと。
  • 合成データ、UCI のマルチクラスからバンディットへの変換、および Criteo の反事後的分析チャレンジデータセットを用いて、手法の妥当性を検証すること。

提案手法

  • 報酬重み付き交差エントロピー損失を用いて行動選択を最適化する、方策改善(PIL)と方策模倣(IML)を組み合わせた surrogate 目的関数である PIL-IML を提案する。
  • PIL と Clipped-IPWE が両方とも、バニラ IPWE の下界の代替指標であることを確立し、それらの使用に理論的根拠を与える。
  • IML と IPWE の分散推定との関係を導出し、IML の不足適合が交絡要因やモデル誤指定を示す信号であることを示す。
  • 対数分離性とテイラー近似を用いて、IML を自然方策勾配と結びつけ、既存の強化学習理論に根拠を与える。
  • 実際の IPWE 評価の安定化のため、重みクリッピングとギャップフィリング技術を適用し、特に重尾分布の重要度重みに対して有効である。
  • Criteo データセットにおける性能評価に、ブートストラップ信頼区間とペアド仮説検定を用い、IPWE、POEM、およびグリーディ方策と比較する。

実験結果

リサーチクエスチョン

  • RQ1行動確率が欠落している状況で、方策模倣(IML)が、分散低減を実現する安定な IPWE の代替指標として機能できるか?
  • RQ2IML は IPWE の分散推定および強化学習における自然方策勾配とどのように関係しているか?
  • RQ3報酬重み付き交差エントロピー損失(方策勾配の目的関数と等価)は、報酬モデルなしの状況においても、Q学習に代わる頑健な代替手段を提供できるか?
  • RQ4PIL-IML は IML の不足適合を通じて、交絡変数やモデル誤指定の存在を検出できるか?
  • RQ5実世界データにおいて、POEM や IPWE といった最先端手法と比較して、PIL-IML の推定精度と安定性はどの程度か?

主な発見

  • Criteo の反事後的分析データセットにおいて、PIL-IML はオフライン推定の 95% 信頼区間 (52.3, 53.7) ×10⁴ を達成し、IPWE の (51.9, 54.5) ×10⁴ および POEM の (51.4, 53.7) ×10⁴ を上回った。
  • PIL-IML から導出されたグリーディ方策は (53.1, 55.2) ×10⁴ の性能を示し、実現可能な IML ベースラインを上回り、報酬に依存しないグリーディ方策が近似的に最適である可能性を示した。
  • IML の不足適合は、交絡変数やモデル誤指定を検出するための必要条件ではあるが、十分条件ではないことが判明した。
  • 特に最大重みが 49,000 に達する重尾分布の重要度重みに対して、IML 正則化を用いることで IPWE 評価の分散が低減された。
  • 行動確率が欠落している状況でも PIL-IML は頑健性を示し、行動確率が利用可能な場合、IPWE と同等の性能を発揮した。また、交絡要因が存在する状況では Q学習に基づくアプローチを上回った。
  • 重みクリッピングとギャップフィリングの適用により、安定性が向上し、特にグローバルクリックレートが約 5% の低クリックレート環境において、上界の過大評価が低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。