QUICK REVIEW
[论文解读] A Batch, Off-Policy, Actor-Critic Algorithm for Optimizing the Average Reward
Susan A. Murphy, Yanzhen Deng|arXiv (Cornell University)|Jul 18, 2016
Advanced Bandit Algorithms Research参考文献 23被引用 17
一句话总结
本文提出了一种批量、离策略的演员-critic算法,用于在马尔可夫决策过程中学习最优随机治疗策略,以最大化平均奖励,特别适用于移动健康应用。该方法利用来自多个个体的离策略数据,通过基函数估计差异值函数,并使用策略梯度方法优化参数化策略,在一项真实世界的戒烟戒酒研究中实现了更优的治疗交付效果。
ABSTRACT
We develop an off-policy actor-critic algorithm for learning an optimal policy from a training set composed of data from multiple individuals. This algorithm is developed with a view towards its use in mobile health.
研究动机与目标
- 开发一种离策略、批量的演员-critic算法,从多个个体的聚合异构数据中学习最优治疗策略。
- 通过学习最大化长期平均奖励的策略,实现在移动健康中个性化、动态的干预。
- 通过学习考虑用户差异性和治疗负担的随机策略,支持在行为健康中的实际部署。
- 通过使用低维参数化策略和可解释特征,促进与领域专家的整合。
- 提供一种可扩展、鲁棒的方法,从观察数据中学习策略,而无需在线交互。
提出的方法
- 该算法在批量设置下运行,从行为策略下收集的轨迹数据集中学习,无需在线交互。
- 其评论组件通过基函数近似求解贝尔曼方程(至多一个常数),估计差异值函数 $ V^\pi(s) $。
- 演员组件通过特征向量 $ \phi(s) $ 上的逻辑链接函数参数化随机策略 $ \pi_\theta(a|s) $,参数为 $ \theta $。
- 通过重要性采样利用离策略数据,使用策略梯度方法更新策略参数,以最大化平均奖励 $ \eta^\pi $。
- 使用MARS(多元自适应回归样条)基函数近似差异值函数,以捕捉非线性状态依赖关系。
- 该算法通过在来自多个个体的独立轨迹数据集上进行一系列批量更新进行训练,每个个体在固定行为策略下遵循一个MDP。
实验结果
研究问题
- RQ1离策略、批量的演员-critic算法能否有效从多个个体收集的观察数据中学习到最大化平均奖励的治疗策略?
- RQ2该方法在具有复杂、时变状态特征的真实世界移动健康数据上泛化能力如何?
- RQ3整合自我控制需求和治疗负担的代理变量是否能提升即时自适应干预的性能和可接受性?
- RQ4该算法在值函数近似和特征选择中的噪声下有多强的鲁棒性?
- RQ5领域专家能否解释并验证该结果策略在行为健康中的有效性?
主要发现
- 对于自我控制需求无增加且无治疗负担的学生,所学习的策略以75%的概率推荐治疗,表明其高度响应性。
- 对于自我控制需求增加且治疗负担增加的学生,策略将治疗推荐概率降低至51%,反映出其接受度下降。
- 该算法在治疗交付中达到了95%的依从性阈值,确保95%的推荐时间点在可用性范围内,治疗概率介于0.05至0.95之间。
- 该方法对值函数近似中的噪声表现出鲁棒性,表明其具有自动基函数选择的潜力。
- 策略系数具有可解释性,deltacontrol的权重为负(−0.42),burden的权重为正(0.63),与行为理论一致。
- 该方法成功从真实智能手机研究数据中学习到策略,显示出通过个性化、自适应干预减少重度饮酒和吸烟的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。