Skip to main content
QUICK REVIEW

[論文レビュー] Learning Optimal Policies from Observational Data

Onur Atan, William R. Zame|arXiv (Cornell University)|Feb 23, 2018
Advanced Causal Inference Techniques参考文献 21被引用数 6
ひとこと要約

この論文では、既知の傾向スコアが不要な観測データから最適方策を学習するためのドメイン adversarial ニューラルネットワーク手法であるDACPOLを提案する。H-発散を最小化することで、選択バイアスを低減するバランスの取れた表現を学習し、半教師付きの乳がんおよびStatlogデータセットにおいて、POEM や IPS といったベースライン手法を上回る性能を発揮し、方策損失が低く、不要な特徴量に対してより頑健である。

ABSTRACT

Choosing optimal (or at least better) policies is an important problem in domains from medicine to education to finance and many others. One approach to this problem is through controlled experiments/trials - but controlled experiments are expensive. Hence it is important to choose the best policies on the basis of observational data. This presents two difficult challenges: (i) missing counterfactuals, and (ii) selection bias. This paper presents theoretical bounds on estimation errors of counterfactuals from observational data by making connections to domain adaptation theory. It also presents a principled way of choosing optimal policies using domain adversarial neural networks. We illustrate the effectiveness of domain adversarial training together with various features of our algorithm on a semi-synthetic breast cancer dataset and a supervised UCI dataset (Statlog).

研究の動機と目的

  • 観測データから最適方策を学ぶ課題に対処すること。ここでは、選択バイアスと欠落した反実仮想的結果が、信頼性のある方策評価を妨げる。
  • 既存の反実仮想的推定技術の主な制限である、既知の傾向スコアを必要としない手法を開発すること。
  • 観測データとランダム化データの分布間のH-発散を最小化することで、方策結果評価の推定誤差を低減すること。
  • 2つの行動に限定された先行研究を拡張し、高次元の行動空間においても有効な方策学習を可能にすること。
  • 逆傾向スコア推定器における分散の増大を引き起こす不要な特徴量に対して、より頑健な性能を向上させること。

提案手法

  • 観測データとランダム化データの分布間のH-発散と方策結果の推定誤差の間の理論的バインディングを提示する。
  • 観測データとランダム化データの分布間で識別不能な表現を学習するドメイン adversarial ニューラルネットワークフレームワークを導入する。
  • ハイパーパrameter λ を用いて、方策損失とドメイン adversarial 損失のトレードオフを最適化する。
  • 2ストリームニューラルネットワークアーキテクチャを採用:一方のヘッドは結果を予測し、他方のヘッドはドメイン(ソース対ターゲット)を分類することで、ドメイン不変性を強制する。
  • adversarial 学習を用いてH-発散を最小化し、傾向スコアが不要な状況でも、分布間でバランスの取れた表現を効果的に得る。
  • ログ政策に依存しない表現不変性を保証しながら、観測データ上で学習することで方策最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1既知の傾向スコアが不明な観測データから学習する場合、方策結果の推定誤差を理論的にどのようにバインドできるか。
  • RQ2ドメイン adversarial 学習は、観測データからの方策学習における選択バイアスをどの程度低減できるか。
  • RQ3POEM や IPS といった既存手法と比較して、提案手法の方策損失と不要な特徴量への頑健性はどのように異なるか。
  • RQ4ドメイン adversarial 損失の重み λ を変化させた場合、方策性能と表現のバランスにどのような影響を与えるか。
  • RQ5不要な特徴量に起因する選択バイアスは、逆傾向スコアに依存する手法と比較して、DACPOL の性能にどのように影響を与えるか。

主な発見

  • 半教師付き乳がんデータセットにおいて、DACPOL は 0.292 ± 0.006 の方策損失を達成し、POEM(0.394 ± 0.004)や IPS(0.397 ± 0.004)を著しく上回った。
  • Statlog データセットでは、DACPOL が 0.249 ± 0.015 の損失を達成し、POEM(0.432 ± 0.016)や IPS(0.454 ± 0.017)を上回った。
  • λ = 0 に設定した DACPOL(0) は DACPOL よりも性能が悪く、ドメイン adversarial 学習が表現のバランスを改善することで性能向上を達成していることを示している。
  • 選択バイアスが高まる(σ が高くなる)に従い、DACPOL と DACPOL(0) の性能差が拡大し、偏ったデータに対してより高い頑健性を示している。
  • 不要な特徴量が存在する状況でも、DACPOL は安定した性能を維持した一方、POEM の性能は逆傾向スコアの分散増大により著しく低下した。
  • DACPOL のドメイン adversarial 損失は、最適な λ で最小値を示し、その後性能が低下した。これにより、予測力とドメイン不変性の最適なトレードオフが存在することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。