[論文レビュー] Off-Policy Estimation of Long-Term Average Outcomes With Applications to Mobile Health
本稿では、異なる行動方針のもとで収集された履歴データを用いて、モバイルヘルス(mHealth)介入における長期平均の結果をオフポリシー推定する手法を提案する。本手法は、マイクロランダマイズド・トライアル(MRT)のデータを用いて、場所に基づく方針や常に治療する方針といった事前に指定されたmHealth方針のパフォーマンスを評価するための二重にロバストな推定量と信頼区間を導入しており、場所に基づく方針が『何もしない』方針に比べて30分間の歩数を約22%増加させることを示している。
Due to the recent advancements in wearables and sensing technology, health scientists are increasingly developing mobile health (mHealth) interventions. In mHealth interventions, mobile devices are used to deliver treatment to individuals as they go about their daily lives. These treatments are generally designed to impact a near time, proximal outcome such as stress or physical activity. The mHealth intervention policies, often called just-in-time adaptive interventions, are decision rules that map an individual’s current state (e.g., individual’s past behaviors as well as current observations of time, location, social activity, stress, and urges to smoke) to a particular treatment at each of many time points. The vast majority of current mHealth interventions deploy expert-derived policies. In this article, we provide an approach for conducting inference about the performance of one or more such policies using historical data collected under a possibly different policy. Our measure of performance is the average of proximal outcomes over a long time period should the particular mHealth policy be followed. We provide an estimator as well as confidence intervals. This work is motivated by HeartSteps, an mHealth physical activity intervention. Supplementary materials for this article are available online.
研究の動機と目的
- 異なる行動方針のもとで収集されたデータを用いて、mHealth方針の長期平均の即時的結果についての推論を可能にする。
- 専門家が導出したmHealth介入方針のデータ駆動型評価の欠如に対処する。
- 既知の確率的ランダム化確率を有する順序的意思決定設定において、柔軟で統計的に妥当な方針評価手法を開発する。
- 複数の候補方針のパフォーマンスを比較可能にするために、データに基づく即時の適応的介入の設計を支援する。
- マイクロランダマイズド・トライアル(MRT)の有用性を即時の因果推論を超えて、長期的方針評価へと拡張する。
提案手法
- mHealth介入における順序的意思決定をモデル化するため、マーカフ決定過程(MDP)フレームワークを用いる。
- 結果回帰と逆確率重み付けを組み合わせることで、長期平均報酬の二重にロバストな推定量を適用する。
- 再生核ヒルベルト空間(RKHS)に径数基底関数カーネルを用いて、相対的価値関数およびQ関数をモデル化する。
- 推定量の漸近正規性を導出し、方針パフォーマンスの有効な信頼区間を構築する。
- RKHSに基づく推定における正則化パラメータの選択に、データ駆動型チューニング手順を用いる。
- 半パラメトリックなフレームワークでベルマン方程式を解き、目的方針下での長期平均結果を推定する。
実験結果
リサーチクエスチョン
- RQ1異なる行動方針のもとで収集されたデータを用いて、目的mHealth方針の長期平均の即時的結果を正確に推定できるか?
- RQ2行動方針が既知で確率的である状況において、mHealth方針のパフォーマンスの有効な信頼区間をどのように構築できるか?
- RQ3場所に基づく治療方針は、『何もしない』方針や『常に治療する』方針に比べ、長期的な身体活動の結果において優れているか?
- RQ4モデルの誤指定や小標本サイズの下で、本手法はどのように性能を示すか?
- RQ5本手法は、二値の即時的結果や非定常環境へと拡張可能か?
主な発見
- 場所に基づく方針(π_location)における推定平均30分間歩数は3.155であり、95%信頼区間は[2.893, 3.417]であった。これは『何もしない』方針に比べて統計的に有意な改善を示している。
- 『何もしない』方針の推定平均報酬は2.962であり、差分(π_location - π_nothing)の95%信頼区間は[-0.016, 0.402]であった。これは歩数が約22%増加する可能性を示唆している。
- 『常に治療する』方針の推定平均報酬は3.127であり、差分(π_location - π_always)の95%信頼区間は[-0.161, 0.217]であった。これは両者の間に有意な差がないことを示している。
- シミュレーションにおいて、適切な被覆確率が達成されており、提案された信頼区間の有効性が検証された。
- RKHS正則化パラメータのチューニング手順は、有限標本におけるバイアスと分散のバランスを効果的にとった。
- HeartStepsデータ(n=37)を用いた事例研究により、本手法が長期的結果を有する実世界のmHealthデータに適用可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。