[論文レビュー] Policy Learning under Biased Sample Selection
本稿は、未観測の異質性が有界である$Γ$-バイアス付きサンプリングフレームワークを用いてサンプリングバイアスをモデル化することで、バイアス付きサンプル選択下でのロバストなポリシー学習を提案する。最適なマキシマインおよびマキシマインゲインポリシーは、条件付き平均処置効果(CATE)と条件付きリスク価値(CVaR)に依存し、ネガティブな外部妥当性の失敗が発生しても、ネガティブパrameterのプラグイン推定を伴わずにパフォーマンス保証を可能にする。
Practitioners often use data from a randomized controlled trial to learn a treatment assignment policy that can be deployed on a target population. A recurring concern in doing so is that, even if the randomized trial was well-executed (i.e., internal validity holds), the study participants may not represent a random sample of the target population (i.e., external validity fails)--and this may lead to policies that perform suboptimally on the target population. We consider a model where observable attributes can impact sample selection probabilities arbitrarily but the effect of unobservable attributes is bounded by a constant, and we aim to learn policies with the best possible performance guarantees that hold under any sampling bias of this type. In particular, we derive the partial identification result for the worst-case welfare in the presence of sampling bias and show that the optimal max-min, max-min gain, and minimax regret policies depend on both the conditional average treatment effect (CATE) and the conditional value-at-risk (CVaR) of potential outcomes given covariates. To avoid finite-sample inefficiencies of plug-in estimates, we further provide an end-to-end procedure for learning the optimal max-min and max-min gain policies that does not require the separate estimation of nuisance parameters.
研究の動機と目的
- ランダム化比較試験(RCT)から得られる研究対象が代表的でないために発生する外部妥当性の失敗の課題に対処すること。
- サンプリングバイアスにより研究参加者がターゲット集団を代表していない場合でも、依然としてロバストなままであるポリシー学習手法を開発すること。
- 未観測要因が選択に影響を与えるがその影響が有界である最悪ケースのサンプリングバイアスにおいて、パフォーマンス保証を提供すること。
- ポリシー学習におけるネガティブパrameterのプラグイン推定による有限標本の非効率性を回避すること。
- 部分同定性のもとで、最適なマキシマインおよびマキシマインゲインポリシーを学習するエンドツーエンドの手順を導出し、実装すること。
提案手法
- 任意の共変量依存選択を許容するが、未観測の異質性が有界である$\Gamma$-バイアス付きサンプリングフレームワークを用いてサンプリングバイアスをモデル化する。
- サンプリングバイアス下での最悪ケースの福祉に関する部分同定限界を導出し、最適ポリシーが潜在的アウトカムのCATEとCVaRの両方に依存することを示す。
- ネガティブパrameterの別個推定を回避するエンドツーエンドの学習手順を提案し、観測データと$\Gamma$-バイアスに整合するすべての妥当なターゲット分布の下での最悪ケース期待アウトカムを直接最適化することで実現する。
- 観測データと$\Gamma$-バイアスに一致するすべての妥当なターゲット分布の下で、最悪ケース期待アウトカムを最大にするポリシーを学ぶためにミニマックス定式化を用いる。
- 最悪ケースの条件付きアウトカム分布を、$\zeta(\Gamma) = \frac{1}{\Gamma+1}$-分位数より上位と下位のアウトカムにそれぞれ$\Gamma^{-1}$および$\Gamma$の重みを割り当てる定量的構成を用いる。
- 最適ポリシーがCATEとCVaRの組み合わせによって決定され、未観測の選択効果に対してロバストであることが示される。
実験結果
リサーチクエスチョン
- RQ1サンプリングバイアスにより研究集団がターゲット集団を代表していない場合でも、パフォーマンス保証を維持する処置割り当てポリシーをどのように学習できるか?
- RQ2$\Gamma$-バイアス付きサンプリング下での最悪ケースの福祉は何か? そして、観測可能なデータを用いてどのように特徴づけられるか?
- RQ3最適なマキシマインおよびマキシマインゲインポリシーは、条件付き平均処置効果(CATE)と条件付きリスク価値(CVaR)にどのように依存するか?
- RQ4ロバストなポリシー学習において、ネガティブパrameterのプラグイン推定による有限標本の非効率性を回避できるか?
- RQ5ポリシーのパフォーマンス下限を最大化する潜在的アウトカムの最悪ケース分布の構造は何か?
主な発見
- 最適なマキシマインポリシーは、共変量を条件とする潜在的アウトカムの条件付き平均処置効果(CATE)と条件付きリスク価値(CVaR)に依存する。
- 最適なマキシマインゲインポリシーもCATEとCVaRに依存し、平均パフォーマンスと最悪ケースのロバストネスのトレードオフを反映する。
- $\Gamma$-バイアス付きサンプリング下での潜在的アウトカムの最悪ケース分布は、$\frac{1}{\Gamma+1}$-分位数より上位のアウトカムに$\Gamma^{-1}$、下位のアウトカムに$\Gamma$の重みを割り当てる。
- 提案されたエンドツーエンド手順は、ネガティブパrameterの別個推定を回避し、プラグイン法と比較して有限標本の効率性が向上する。
- 最悪ケース福祉の部分同定限界が導出され、$\Gamma$-バイアス付きサンプリングに一致するすべての分布に対してパフォーマンス保証が成り立つことが示された。
- この手法により、ターゲット集団が研究集団と異なる場合でも、未観測の選択バイアスによる外部妥当性の失敗に耐えうる学習済みポリシーを保証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。