Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Causal Reinforcement Learning with Confounded Observational Data

Lingxiao Wang, Zhuoran Yang|arXiv (Cornell University)|Jun 22, 2020
Advanced Bandit Algorithms Research参考文献 38被引用数 13
ひとこと要約

本論文は、観察的データに混同要因が存在する状況でも、オンライン強化学習におけるサンプル効率を向上させる、証明可能に効率的な因果的強化学習アルゴリズムDOVIを提案する。部分的または観測されない混同要因によるバイアスを補正し、オフラインデータからの情報量を定量化することで、DOVIは、観察的データがより情報が多くなるにつれて小さくなる乗法的要因でリグレットを低減する。

ABSTRACT

Empowered by expressive function approximators such as neural networks, deep reinforcement learning (DRL) achieves tremendous empirical successes. However, learning expressive function approximators requires collecting a large dataset (interventional data) by interacting with the environment. Such a lack of sample efficiency prohibits the application of DRL to critical scenarios, e.g., autonomous driving and personalized medicine, since trial and error in the online setting is often unsafe and even unethical. In this paper, we study how to incorporate the dataset (observational data) collected offline, which is often abundantly available in practice, to improve the sample efficiency in the online setting. To incorporate the possibly confounded observational data, we propose the deconfounded optimistic value iteration (DOVI) algorithm, which incorporates the confounded observational data in a provably efficient manner. More specifically, DOVI explicitly adjusts for the confounding bias in the observational data, where the confounders are partially observed or unobserved. In both cases, such adjustments allow us to construct the bonus based on a notion of information gain, which takes into account the amount of information acquired from the offline setting. In particular, we prove that the regret of DOVI is smaller than the optimal regret achievable in the pure online setting by a multiplicative factor, which decreases towards zero when the confounded observational data are more informative upon the adjustments. Our algorithm and analysis serve as a step towards causal reinforcement learning.

研究の動機と目的

  • 豊富ではあるが混同された観察的データを活用することで、オンライン強化学習におけるサンプル効率を向上させること。
  • 未観測の変数が行動方策、報酬、ダイナミクスに影響を与える混同バイアスの問題に対処すること。
  • 介入的データと観察的データの両方からの情報量を測定することで、探索における不確実性の定量化を可能にすること。
  • 混同されたデータからの情報を利用したボーナス機構を構築し、リグレットを低減すること。
  • 純粋なオンライン強化学習よりも、証明可能な優れたリグレットバウンドを達成すること。改善度は、観察的データの情報量に比例する。

提案手法

  • 混同された観察的データを処理するためのDeconfounded Optimistic Value Iteration (DOVI)アルゴリズムを提案する。
  • 2段階推定アプローチを用いる:まず、条件付き独立性の仮定を用いて、未観測の混同要因を考慮した表現を用いて観察的データを補正する。
  • 混同された状態でも、不確実性の低減を定量化できる、新しい情報量の測度を導入する。
  • この情報量に基づいたオピティミスティックボーナスを構築し、オンラインフェーズでの探索をガイドする。
  • オフラインおよびオンラインのデータストリームを統合した完全なフィルトレーションを採用し、混同下でも有効な集中不等式を保証する。
  • 行列濃度不等式と対数行列式の上限を用いて、高確率でのリグレット保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1混同された観察的データは、オンライン強化学習におけるサンプル効率の向上に活用可能か?
  • RQ2未観測の変数が方策、報酬、遷移に影響を与える混同バイアスは、オフラインデータにおいてどのように是正可能か?
  • RQ3探索における不確実性の定量化を支援する、混同された観察的データからの有効で情報豊富な情報量の測定方法は何か?
  • RQ4介入的データと混同された観察的データを組み合わせた場合、証明可能な効率的リグレットバウンドを達成できるか?
  • RQ5混同された観察的データの情報量に応じて、リグレットの改善度はどのようにスケーリングされるか?

主な発見

  • DOVIは、調整後の混同された観察的データがより情報豊かになるにつれて、ゼロに近づく乗法的要因で、純粋なオンライン強化学習における最適リグレットよりも小さいリグレットバウンドを達成する。
  • 未観測の混同要因に対しても、条件付き独立構造をモデル化することで、観察的データの混同バイアスを効果的に補正する。
  • 観察的データからの情報量が形式的に定量化され、その情報量に基づいたボーナスが構築され、探索の効率が向上する。
  • オフラインおよびオンラインデータを含む完全なフィルトレーションを用いることで、推定誤差の高確率集中不等式が確立される。
  • リグレットバウンドは、問題の次元の対数と総ステップ数に依存し、オフラインデータからの情報量に依存する。
  • 理論的分析により、DOVIが証明可能に効率的であり、リグレットの改善度が観察的データセットの質と情報量に比例することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。