[论文解读] The Actor Search Tree Critic (ASTC) for Off-Policy POMDP Learning in Medical Decision Making
本文提出了一种名为行为者搜索树评论家(Actor Search Tree Critic, ASTC)的离策略行为者-评论家强化学习框架,用于部分可观察马尔可夫决策过程(POMDPs)在医疗决策中的应用。该方法利用带有学习到的上下界值的启发式搜索树,高效地处理无限信念状态,同时通过行为者中的连续高斯策略和函数逼近的评论家,实现在真实ICU数据上的端到端训练,从而生成显著优于临床实践的血管活性药物和液体输注剂量策略,显著改善患者预后。
Off-policy reinforcement learning enables near-optimal policy from suboptimal experience, thereby provisions opportunity for artificial intelligence applications in healthcare. Previous works have mainly framed patient-clinician interactions as Markov decision processes, while true physiological states are not necessarily fully observable from clinical data. We capture this situation with partially observable Markov decision process, in which an agent optimises its actions in a belief represented as a distribution of patient states inferred from individual history trajectories. A Gaussian mixture model is fitted for the observed data. Moreover, we take into account the fact that nuance in pharmaceutical dosage could presumably result in significantly different effect by modelling a continuous policy through a Gaussian approximator directly in the policy space, i.e. the actor. To address the challenge of infinite number of possible belief states which renders exact value iteration intractable, we evaluate and plan for only every encountered belief, through heuristic search tree by tightly maintaining lower and upper bounds of the true value of belief. We further resort to function approximations to update value bounds estimation, i.e. the critic, so that the tree search can be improved through more compact bounds at the fringe nodes that will be back-propagated to the root. Both actor and critic parameters are learned via gradient-based approaches. Our proposed policy trained from real intensive care unit data is capable of dictating dosing on vasopressors and intravenous fluids for sepsis patients that lead to the best patient outcomes.
研究动机与目标
- 为解决医疗决策中部分可观察临床状态的挑战,其中真实的生理状态是隐变量,需从不完整、噪声的观测中推断。
- 开发一种可扩展的、在线强化学习方法,用于重症监护病房中连续动作空间(如药物剂量)的决策,基于真实的电子健康记录数据。
- 通过使用带有学习值界的启发式搜索树,结合函数逼近和反向传播,克服精确POMDP解法的不可行性。
- 通过实证验证,基于ASTC学习到的策略在患者预后方面优于临床医生决策,尤其当治疗动作与策略建议接近时。
- 提供一种临床可解释的、非替代性的决策支持系统,增强而非取代临床医生在动态治疗规划中的判断。
提出的方法
- 该方法将患者治疗建模为POMDP,其中信念状态表示对未观测生理状态的后验分布,基于纵向临床数据推断。
- 使用高斯混合模型基于观测历史轨迹表示患者状态的信念分布。
- 行为者网络采用直接在动作空间参数化的连续高斯策略,以建模血管活性药物和静脉输液的剂量决策。
- 评论家使用函数逼近器,为每个信念状态估计真实值函数的上下界,从而在树搜索过程中实现更紧密的值估计。
- 启发式搜索树仅扩展已遇到的信念状态,基于上界估计选择动作,并将值界反向传播至根节点,实现迭代优化。
- 通过基于梯度的优化更新行为者和评论家参数,实现从回顾性EHR数据中进行离策略学习,无需行为策略覆盖。
实验结果
研究问题
- RQ1离策略行为者-评论家框架能否在具有连续动作空间的部分可观察医疗环境中,有效学习近似最优治疗策略?
- RQ2如何在搜索树中高效学习并传播值函数界,以近似POMDP中无限信念状态的真实值?
- RQ3在脓毒症管理中,临床医生决策与学习策略对齐在多大程度上能改善患者预后?
- RQ4在搜索树框架中对值界进行函数逼近,能否在真实ICU数据中提升样本效率和收敛性?
- RQ5当以生存率和治疗偏离度为指标时,所提出的策略性能与临床医生实践相比如何?
主要发现
- 当临床医生更密切遵循ASTC的剂量建议时,患者预后显著改善,表现为更高的回报(如生存率、出院率),尤其在血管活性药物和静脉输液方面。
- 治疗偏离ASTC策略越少的患者,生存率越高,其中与策略建议平均绝对偏差最小的组别预后最佳。
- 在幸存者中,ASTC策略与临床医生决策高度一致;而在非幸存者中,策略偏离更大,特别是在液体管理方面,提示策略对齐程度与死亡率之间可能存在关联。
- 在搜索树中使用学习到的上下界值,即使在无限信念空间下,也能实现有效的值估计和策略改进,优于静态或非自适应的界。
- 通过高斯策略网络成功处理了连续动作空间,实现了对血管活性药物和液体输注的精细控制,具有临床意义。
- 实证评估表明,ASTC策略在未见ICU患者上泛化能力良好,自助法置信区间确认了其在不同生存群体中的一致性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。