[论文解读] Group-driven Reinforcement Learning for Personalized mHealth Intervention
该论文提出了一种群体驱动的强化学习(RL)框架,用于个性化移动健康(mHealth)干预,通过基于行为相似性对用户进行聚类,并在每个群体内学习共享策略。该方法在相似用户之间平衡数据共享,同时保持足够的个性化学习,显著提升了长期平均奖励——相比最先进方法最高提升82.4步,尤其在用户数据有限的情况下表现更优。
Due to the popularity of smartphones and wearable devices nowadays, mobile health (mHealth) technologies are promising to bring positive and wide impacts on people's health. State-of-the-art decision-making methods for mHealth rely on some ideal assumptions. Those methods either assume that the users are completely homogenous or completely heterogeneous. However, in reality, a user might be similar with some, but not all, users. In this paper, we propose a novel group-driven reinforcement learning method for the mHealth. We aim to understand how to share information among similar users to better convert the limited user information into sharper learned RL policies. Specifically, we employ the K-means clustering method to group users based on their trajectory information similarity and learn a shared RL policy for each group. Extensive experiment results have shown that our method can achieve clear gains over the state-of-the-art RL methods for mHealth.
研究动机与目标
- 解决现有mHealth RL方法的局限性,这些方法假设用户完全同质或完全异质。
- 提出一种更符合实际的框架,承认用户彼此之间部分相似但并非全部相同。
- 在降低数据复杂性和提升每组学习样本数量之间取得平衡。
- 在mHealth应用中典型的低数据环境下,提升策略的稳定性和性能。
- 在基于聚类的策略学习中,验证对群体数量估计错误的鲁棒性。
提出的方法
- 使用K-means聚类将用户根据其行为轨迹数据的相似性进行分组。
- 利用组内所有可用数据,为每个聚类学习一个共享的深度Q网络策略。
- 采用带线性函数逼近的价值函数估计的演员-评论家RL框架:$ Q_{\mathbf{w}} = \mathbf{w}^T \mathbf{x}(s,a) $。
- 使用参考状态分布 $ d_{\text{ref}}(s) $ 和策略参数化 $ \pi_\theta(a|s) $ 来优化期望回报。
- 通过在目标函数 $ \widehat{J}(\theta) = \sum_s d_{\text{ref}}(s) \sum_a \pi_\theta(a|s) Q^{\pi_\theta}(s,a) $ 上使用随机梯度上升来训练策略。
- 使用包含50名用户的合成数据,轨迹长度分别为T=42和T=100,并在K=3和K=7个聚类下进行测试,以评估鲁棒性。
实验结果
研究问题
- RQ1基于行为相似性对用户聚类,是否能提升基于RL的mHealth干预性能,相比同质或完全独立的模型?
- RQ2当真实用户群体数量未知或估计错误时,所提出的群体驱动RL方法表现如何?
- RQ3在轨迹较短、个体用户数据有限的条件下,该方法是否仍能保持性能优势?
- RQ4聚类数量(K)的选择如何影响策略性能和鲁棒性?
- RQ5基于群体的知识共享在多大程度上减少了策略方差,并提升了mHealth应用中的长期奖励?
主要发现
- 当轨迹较短(T=42)时,所提出的群体驱动RL(Gr-RL)方法相比最佳基线方法(Separ-RL)在长期平均奖励(ElrAR)上平均提升了82.4步。
- 在较长轨迹(T=100)下,Gr-RL仍比最先进方法高出49.8至51.7步的ElrAR,表明性能提升具有持续性。
- 在K=3和K=7个聚类下,Gr-RL表现相似且始终位居前列,表明对群体数量估计错误具有鲁棒性。
- 随着轨迹长度增加,该方法的性能增益下降,表明在数据丰富的场景下,基于群体的学习优势相对减小。
- 在短轨迹条件下,较小的K值(如K=3)更有效,强调了数据增强的作用;而在长轨迹条件下,较大的K值(如K=7)更优,有助于简化每组的数据复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。