Skip to main content
QUICK REVIEW

[論文レビュー] Effective Warm Start for the Online Actor-Critic Reinforcement Learning based mHealth Intervention

Feiyun Zhu, Peng Liao|arXiv (Cornell University)|Apr 17, 2017
Smart Grid Energy Management参考文献 11被引用数 6
ひとこと要約

本論文は、過去の研究から得られた履歴データおよび意思決定ルールを活用することで、モバイルヘルス(mHealth)介入におけるオンラインアクタ・クリティック強化学習のための新規なウォームスタート戦略を提案する。事前に学習されたパラメータによるポリシーの初期化と初期学習データの豊かさを組み合わせることで、学習の初期段階から著しく高いパフォーマンスを達成する。30および50のトラジェクトリ長における、最先端の手法と比較して平均報酬がそれぞれ67.57および69.72ステップ向上した。

ABSTRACT

Online reinforcement learning (RL) is increasingly popular for the personalized mobile health (mHealth) intervention. It is able to personalize the type and dose of interventions according to user's ongoing statuses and changing needs. However, at the beginning of online learning, there are usually too few samples to support the RL updating, which leads to poor performances. A delay in good performance of the online learning algorithms can be especially detrimental in the mHealth, where users tend to quickly disengage with the mHealth app. To address this problem, we propose a new online RL methodology that focuses on an effective warm start. The main idea is to make full use of the data accumulated and the decision rule achieved in a former study. As a result, we can greatly enrich the data size at the beginning of online learning in our method. Such case accelerates the online learning process for new users to achieve good performances not only at the beginning of online learning but also through the whole online learning process. Besides, we use the decision rules achieved in a previous study to initialize the parameter in our online RL model for new users. It provides a good initialization for the proposed online RL algorithm. Experiment results show that promising improvements have been achieved by our method compared with the state-of-the-art method.

研究の動機と目的

  • 初期データが不足するため、mHealthにおけるオンライン強化学習(RL)の初期段階のパフォーマンスが低いという問題に対処すること。
  • 最初のインタラクションから介入の質を向上させることで、mHealthアプリケーションにおけるユーザーの離脱を低減すること。
  • 過去の研究から得たデータおよび意思決定ルールを活用して、初期学習データを豊かにし、ポリシーの初期化を改善すること。
  • 個人向けmHealth介入におけるオンラインRLの収束を加速し、パフォーマンスを向上させること。
  • 効果的なウォームスタートが初期段階のオンライン学習において、ランダムウォームスタートを著しく上回ることを示すこと。

提案手法

  • 過去の研究から得た意思決定ルールとデータを活用して、オンラインRLモデルにおけるポリシーのパラメータを初期化する。
  • ロジスティック関数を用いたパラメトリックなポリシーを採用:$\pi_{\theta}(a|s) = \exp[a\theta^T\phi(s)] / \{1 + \exp[\theta^T\phi(s)]\}$、ここで $\phi(s) = [1, s^T]^T$。
  • 特徴量 $\mathbf{x}(s,a) = [1, s^T, a, s^T a]^T \in \mathbb{R}^{2p+2}$ を用いた価値関数推定を伴うアクタ・クリティックフレームワークを採用する。
  • ランダムウォームスタート(RWS)とは異なり、最初のデータタプルを受信した直後に学習を開始する。
  • 学習の進行に従って、新しいユーザーデータの重みを段階的に増加させる。
  • マルコフ決定過程(MDP)における遅延報酬をモデル化するため、割引率 $\gamma \in [0, 1)$ を用いる。

実験結果

リサーチクエスチョン

  • RQ1過去の研究から得た履歴データおよび意思決定ルールを活用することで、mHealthにおけるオンラインRLの初期段階のパフォーマンスが著しく向上するか?
  • RQ2効果的なウォームスタートは、ランダムウォームスタートと比較して、高パフォーマンスなポリシーに到達するまでの遅延を短縮するか?
  • RQ3過去の研究結果を活用した個別化されたポリシー初期化は、mHealthアプリケーションにおけるユーザーの継続率を向上させられるか?
  • RQ4累積報酬の観点から、提案手法のウォームスタート手法はランダムウォームスタートと比較してどのように異なるか?
  • RQ5本手法は、mHealthにおける逐次的意思決定のオンラインアクタ・クリティックRLにおいて、収束をどの程度加速するか?

主な発見

  • 提案手法のNew Warm Start(NWS-RL)は、$T=30$ で平均報酬1393.1を達成し、2番目に良い手法($T_0=10$ のRWS-RL)を67.57ステップ上回った。
  • $T=50$ では、NWS-RLが平均報酬1405.0を達成し、2番目に良い手法を69.72ステップ上回った。
  • NWS-RLは最初のデータタプルを受け取った直後に学習を開始するが、RWS-RLは$T_0=5$または$10$のサンプルを待ってから更新を開始する。
  • $\gamma=0$(コンテキストラルバンディット設定)でも、NWS-RLは1367.6の平均報酬を達成し、RWS-RL($T_0=10$)の1349.7を上回った。
  • すべての割引率$\gamma$において、NWS-RLはRWS-RLを常に上回り、中間の$\gamma$値で最も大きな向上が見られた。
  • 結果から、効果的なウォームスタートが、mHealth介入におけるオンラインRLの初期段階のパフォーマンスを著しく向上させ、学習を加速することが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。