Skip to main content
QUICK REVIEW

[論文レビュー] Markovian Interference in Experiments

Vivek F. Farias, Andrew A. Li|arXiv (Cornell University)|Jun 6, 2022
Transportation and Mobility InnovationsEngineering被引用数 18
ひとこと要約

本稿では、限られた在庫などの共有制約によって影響を受けるシステム状態に介入が及ぶマルコフ的干渉(Markovian interference)を伴う実験における因果推論のための差分Q(Differences-In-Q's, DQ)推定器を提案する。本手法は、オフポリシー手法と比較して2次バイアスを達成し、分散を指数関数的に低減する、新しいオンポリシー推定フレームワークを活用することで、バイアス・バリアンスのトレードオフを著しく改善し、ヒューリスティック推定器および不偏推定器を理論的・シミュレーション的に上回る性能を発揮する。

ABSTRACT

We consider experiments in dynamical systems where interventions on some experimental units impact other units through a limiting constraint (such as a limited inventory). Despite outsize practical importance, the best estimators for this `Markovian' interference problem are largely heuristic in nature, and their bias is not well understood. We formalize the problem of inference in such experiments as one of policy evaluation. Off-policy estimators, while unbiased, apparently incur a large penalty in variance relative to state-of-the-art heuristics. We introduce an on-policy estimator: the Differences-In-Q's (DQ) estimator. We show that the DQ estimator can in general have exponentially smaller variance than off-policy evaluation. At the same time, its bias is second order in the impact of the intervention. This yields a striking bias-variance tradeoff so that the DQ estimator effectively dominates state-of-the-art alternatives. From a theoretical perspective, we introduce three separate novel techniques that are of independent interest in the theory of Reinforcement Learning (RL). Our empirical evaluation includes a set of experiments on a city-scale ride-hailing simulator.

研究の動機と目的

  • マーケットの干渉(Markovian interference)を伴う実験における平均処置効果(ATE)の推定において、理論的裏付けがあり、低バイアス・低分散な推定器が不足している問題に対処すること。
  • 単純ラウンドロビン(simple randomization)の下で、問題をマルコフ決定過程(MDP)におけるポリシー評価として形式化し、複雑な実験設計に依存しないこと。
  • 処置効果における2次バイアスを維持しつつ、オフポリシー評価よりも明確に小さい分散を達成する、オンポリシー推定器を開発すること。
  • 強化学習における理論的基盤を確立し、ATEの新規なテイラー展開的表現と、ポリシー評価におけるバイアス・バリアンス解析を含めること。

提案手法

  • DQ推定器を、ポリシー評価の恒等式を変更した形で用いる、新しいオンポリシー推定器として提案。標準的な報酬の代わりに、ターゲットポリシー下での期待報酬を用いる。
  • 行動ポリシーの定常分布および価値関数に基づく代替目的関数を導出。バイアスの分析には摂動バウンドを用いる。
  • ATEのテイラー展開的表現(定理5)を用い、遷移確率とポリシーの間の距離を用いてバイアスを特徴付ける。
  • 報酬をターゲットポリシーの期待報酬で再重み付けした補助MDP上で、Q関数およびV関数を計算する、変更されたダイニキン型恒等式を導入。
  • 信頼領域に類似したフレームワークを採用するが、補助MDPの報酬関数を変更することでバイアスを低減し、DQ推定器の主な性質を導出する。
  • DQ推定器の漸近正規性を確立し、明示的な分散の特徴づけを提供。これにより、オフポリシー推定器と比較して、指数関数的に小さい分散を達成できることを示す。

実験結果

リサーチクエスチョン

  • RQ1マーケットの干渉を伴う実験において、新しいオンポリシー推定器は、不偏なオフポリシー推定器と比較して著しく低い分散を達成できるか?
  • RQ2DQ推定器のバイアス構造は何か? また、既存のオフポリシー推定器およびヒューリスティック推定器と比較して、どのように異なるか?
  • RQ3DQ推定器は、ポリシーに起因する遷移ダイナミクスの変化を考慮した、修正されたポリシー評価恒等式から導出可能か?
  • RQ4処置効果が小さい場合に、DQ推定器は2次バイアスを維持するか? その結果、実用的な性能にどのように影響するか?
  • RQ5DQ推定器は、バイアス・バリアンス制御の向上を通じて、強化学習におけるポリシー最適化を改善するために一般化可能か?

主な発見

  • 介入が遷移確率に $O(\delta)$ の影響を与える場合、DQ推定器は $O(\delta^2)$ の2次バイアスを示す。これは、オフポリシー手法と比較して顕著にバイアスが小さいことを意味する。
  • DQ推定器の分散は、任意の不偏なオフポリシー推定器の分散よりも指数関数的に小さくなる可能性がある。特に高次元または複雑なMDPにおいて顕著である。
  • 都市規模のライドシェアリングシミュレータにおいて、DQ推定器はバイアスおよび平均二乗誤差の両面で最先端の代替手法を上回り、実用的優位性を示した。
  • DQ推定器のバイアスは $O((\delta\delta')^2)$ であり、これは信頼領域の代替目的関数の $O(\delta(\delta')^2)$ のバイアスよりも $\delta$ 倍小さい。$\delta'$ が有界でない場合でも同様に成立する。
  • 理論的分析により、DQ推定器が処置効果の小ささを活用して、望ましいバイアス・バリアンスのトレードオフを達成できることを明らかにした。理論的およびシミュレーション的両面で優位性を示した。
  • 本手法は、強化学習分野において独立した価値を持つ3つの新規技術を導入した:ATEのテイラー展開的表現、修正されたダイニキン恒等式、ポリシー評価バイアスの摂動ベース解析。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。