Skip to main content
QUICK REVIEW

[论文解读] Federated Offline Reinforcement Learning

Doudou Zhou, Yufeng Zhang|arXiv (Cornell University)|Jun 11, 2022
Blockchain Technology Applications and Security被引用 4
一句话总结

本文提出联邦离线动态治疗策略(FDTR),一种面向多中心离线强化学习的通信高效算法,通过多中心线性MDP模型联合学习各中心特异性和共享的策略效应。该方法仅需一次通信轮次即可实现与集中式学习相当的次优性,且在九家ICU的脓毒症数据集上表现出优越性能。

ABSTRACT

Evidence-based or data-driven dynamic treatment regimes are essential for personalized medicine, which can benefit from offline reinforcement learning (RL). Although massive healthcare data are available across medical institutions, they are prohibited from sharing due to privacy constraints. Besides, heterogeneity exists in different sites. As a result, federated offline RL algorithms are necessary and promising to deal with the problems. In this paper, we propose a multi-site Markov decision process model that allows for both homogeneous and heterogeneous effects across sites. The proposed model makes the analysis of the site-level features possible. We design the first federated policy optimization algorithm for offline RL with sample complexity. The proposed algorithm is communication-efficient, which requires only a single round of communication interaction by exchanging summary statistics. We give a theoretical guarantee for the proposed algorithm, where the suboptimality for the learned policies is comparable to the rate as if data is not distributed. Extensive simulations demonstrate the effectiveness of the proposed algorithm. The method is applied to a sepsis dataset in multiple sites to illustrate its use in clinical settings.

研究动机与目标

  • 解决从多个医疗中心的分布式、不可共享的电子健康记录(EHR)中学习最优动态治疗策略(DTRs)的挑战。
  • 克服因数据隐私限制而无法直接聚合多中心EHR数据的问题,同时考虑各中心在治疗方案和患者人群上的异质性。
  • 开发一种通信高效的算法,实现在不共享原始数据的前提下,通过仅交换汇总统计量来实现跨中心的协作策略学习。
  • 利用结构化的多中心MDP模型,实现对顺序临床决策中共享(共性)与中心特异性(异质性)效应的联合分析。
  • 在相同模型假设下,提供与集中式离线强化学习性能相当的次优性理论保证。

提出的方法

  • 构建一个多中心线性马尔可夫决策过程(MDP),其中转移核和奖励函数在已知特征映射下为线性形式,包含共享效应(ϕ₀)和中心特异性效应(ϕ₁)。
  • 通过双线性模型结构将价值函数分解为共性与中心特异性成分,实现对全局与本地策略参数的联合估计。
  • 设计一种联邦策略优化算法,仅需一轮通信,交换各中心的汇总统计量(如梯度或矩估计量)。
  • 采用步骤重要性采样估计器进行离策略评估,实现对各中心学习策略的无偏比较。
  • 将中心层面的协变量(如ICU规模、人员配比)作为共享部分的特征,以建模机构异质性。
  • 通过模型结构隐式引入收缩或正则化技术,提升小样本场景下的泛化能力并减少过拟合。

实验结果

研究问题

  • RQ1联邦离线强化学习框架是否能在不共享原始患者数据的前提下,有效学习多个医疗中心的最优动态治疗策略?
  • RQ2在MDP模型中引入中心特异性和共享效应,相较于同质或中心特异性基线,能否显著提升策略性能?
  • RQ3所提出的通信高效、单轮通信算法在多大程度上能保持与集中式离线强化学习相当的性能?
  • RQ4中心层面的协变量在脓毒症管理等临床场景中,如何随时间影响治疗决策?
  • RQ5当线性MDP假设出现轻微偏离时,尤其在各中心数据量有限的情况下,模型是否仍保持鲁棒性?

主要发现

  • FDTR在九家ICU的多中心脓毒症数据集上,价值函数估计性能显著优于所有基线方法,测试集上的平均价值函数估计值达到0.87。
  • 对中心协变量(如患者流量)的估计系数始终为正,表明在相同治疗下,护理单元患者流量越高,临床结局越好。
  • 中心协变量对治疗决策的影响随时间推移而减弱,表明后期治疗决策更多受患者特异性因素驱动,而非机构特征。
  • 引入非线性基函数并未提升性能,可能源于在各中心样本量有限时的偏差-方差权衡。
  • 该算法实现了与集中式离线强化学习相当的次优性水平,证明单轮通信的联邦学习可有效保持学习效率。
  • 该方法成功捕捉了各中心间的异质性治疗效应,即使在单个中心数据有限或动作分布存在偏差的情况下,也能实现个性化策略学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。