Skip to main content
QUICK REVIEW

[論文レビュー] Distributional Robust Batch Contextual Bandits.

Nian Si, Fan Zhang|arXiv (Cornell University)|Jun 10, 2020
Advanced Bandit Algorithms Research参考文献 79被引用数 6
ひとこと要約

本稿では、不完全な観測データを用いて、敵対的な共変量シフトや未知の分布シフトに対して耐性を持つポリシーを学習する、分布的に堅牢なバッチ文脈的バンディットアルゴリズムを提案する。アンビエントなポリシー評価と一様収束に基づく保証を組み合わせることで、合成的および現実世界の設定において、展開時の分布が学習データとは異なる場合でも、堅牢な性能を達成する。

ABSTRACT

Policy learning using historical observational data is an important problem that has found widespread applications. Examples include selecting offers, prices, advertisements to send to customers, as well as selecting which medication to prescribe to a patient. However, existing literature rests on the crucial assumption that the future environment where the learned policy will be deployed is the same as the past environment that has generated the data--an assumption that is often false or too coarse an approximation. In this paper, we lift this assumption and aim to learn a distributional robust policy with incomplete (bandit) observational data. We propose a novel learning algorithm that is able to learn a robust policy to adversarial perturbations and unknown covariate shifts. We first present a policy evaluation procedure in the ambiguous environment and then give a performance guarantee based on the theory of uniform convergence. Additionally, we also give a heuristic algorithm to solve the distributional robust policy learning problems efficiently. Finally, we demonstrate the robustness of our methods in the synthetic and real-world datasets.

研究の動機と目的

  • 訓練時と展開時の分布が同一であると仮定する従来の文脈的バンディット手法の制限を解決すること。
  • 未知または敵対的な共変量シフト下でも有効であるポリシー学習フレームワークを開発すること。
  • 一様収束に基づく理論的保証を用いて、アンビエントな環境におけるポリシー評価の性能保証を提供すること。
  • 実用的な分布的に堅牢なポリシー学習のための効率的ヒューリスティックアルゴリズムを設計すること。
  • 分布的シフト下において、合成的および現実世界のデータセットで堅牢性を実証すること。

提案手法

  • テスト環境における分布のあいまいさを考慮したポリシー評価手順を提案する。
  • 一様収束理論を活用して、データ分布の敵対的摂動下での性能保証を導出する。
  • 未知の共変量シフトに対して不変なポリシーを学習するための分布的に堅牢な最適化目的関数を定式化する。
  • バッチ設定における堅牢なポリシー学習問題を効率的に解くためのヒューリスティックアルゴリズムを導入する。
  • 完全な文脈-行動履歴が観測されない、観測データ(バンディットデータ)を用いる。
  • アンビエント集合を用いて潜在的な分布的シフトをモデル化し、未観測のデータシフトに対しての耐性を実現する。

実験結果

リサーチクエスチョン

  • RQ1展開環境における未知または敵対的な分布的シフトに対して、文脈的バンディットポリシーを堅牢にできるか?
  • RQ2テスト分布が明確でない、または学習分布とは異なる場合に、どのように信頼性のあるポリシー評価を実施できるか?
  • RQ3バンディットフィードバック下で、分布的に堅牢なポリシー学習に対してどのような理論的保証を提供できるか?
  • RQ4不完全な観測データを用いたバッチ設定において、どのように効率的に堅牢なポリシーを学習できるか?
  • RQ5提案手法は、合成的および現実世界の環境における分布的シフト下で、標準的なベースラインを上回る性能を示すか?

主な発見

  • 提案されたポリシー評価手順は、分布のあいまいさ下でも信頼性の高い性能推定を提供する。
  • 一様収束に基づく理論的保証により、データ分布の敵対的摂動に対して堅牢性が保証される。
  • ヒューリスティックアルゴリズムにより、バッチ文脈的バンディット設定における堅牢なポリシーの効率的学習が可能になる。
  • 合成的および現実世界のデータセットにおける実験結果から、共変量シフト下での手法の堅牢性が確認される。
  • 展開分布が学習データから逸脱する状況下で、標準的な文脈的バンディットベースラインを上回る性能を示す。
  • シフトが大きいか敵対的であっても、手法は強い性能を維持し、実用的な耐性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。