[论文解读] Optimizing Sequential Medical Treatments with Auto-Encoding Heuristic Search in POMDPs
本文提出了一种用于优化顺序性脓毒症治疗的自编码启发式搜索(AEHS)框架,基于部分可观察的马尔可夫决策过程(POMDPs)。通过结合变分推断与循环信念表示,以及启发式引导的后缀树进行价值备份,该方法提升了样本效率,并在离策略评估中优于临床基线,即使在数据不完整的情况下,也表现出优于基于MDP的模型的优越性能。
Health-related data is noisy and stochastic in implying the true physiological states of patients, limiting information contained in single-moment observations for sequential clinical decision making. We model patient-clinician interactions as partially observable Markov decision processes (POMDPs) and optimize sequential treatment based on belief states inferred from history sequence. To facilitate inference, we build a variational generative model and boost state representation with a recurrent neural network (RNN), incorporating an auxiliary loss from sequence auto-encoding. Meanwhile, we optimize a continuous policy of drug levels with an actor-critic method where policy gradients are obtained from a stablized off-policy estimate of advantage function, with the value of belief state backed up by parallel best-first suffix trees. We exploit our methodology in optimizing dosages of vasopressor and intravenous fluid for sepsis patients using a retrospective intensive care dataset and evaluate the learned policy with off-policy policy evaluation (OPPE). The results demonstrate that modelling as POMDPs yields better performance than MDPs, and that incorporating heuristic search improves sample efficiency.
研究动机与目标
- 解决临床观察中存在噪声、不完整以及时间错位的挑战,以优化顺序性治疗。
- 将患者-医生互动建模为POMDPs而非MDPs,以更好地反映现实临床中的不确定性与信息不对称性。
- 通过启发式搜索与信念状态推断,提升强化学习在医疗决策中的数据效率。
- 在稀疏奖励与来自医生轨迹的离策略数据条件下,降低策略梯度估计的偏差与方差。
- 开发一种稳定且可扩展的方法,从回顾性ICU数据中学习最优血管活性药物与液体输注策略。
提出的方法
- 使用带有辅助证据下界(ELBO)损失的变分自编码器,学习患者观察的生成模型,并通过序列蒙特卡洛推断潜在状态。
- 采用循环神经网络(RNN)将历史序列编码为信念状态,实现内存高效的POMDP规划。
- 应用前瞻策略$\hat{\pi}$以并行最佳优先后缀树引导树的扩展,提升价值函数近似性能。
- 通过贝尔曼更新反向传播信念状态值,以树估计值作为目标,提升价值函数准确性。
- 采用演员-评论家框架,结合离策略优势估计,使用截断重要性采样与偏差校正的梯度更新。
- 使用自编码序列蒙特卡洛与粒子滤波,维持潜在状态上的后验分布,实现在缺失数据下的鲁棒信念推断。
实验结果
研究问题
- RQ1在存在噪声与不完整临床观察的情况下,将患者-医生互动建模为POMDPs是否能产生优于MDPs的治疗策略?
- RQ2在医疗强化学习数据稀缺的场景下,使用最佳优先后缀树的启发式搜索是否能提升样本效率?
- RQ3结合自编码的生成模型在多大程度上改善了信念状态推断与策略性能?
- RQ4在奖励稀疏性条件下,该方法与医生行为策略相比,在离策略评估中的表现如何?
- RQ5在树扩展中使用前瞻策略是否能带来比直接策略滚动更快且更稳定的策略学习?
主要发现
- 在所有观察集上,POMDP建模均持续优于MDP建模;AEHS在20名患者变量下超越医生基线,而AE+A2C仅在35名患者变量下实现超越。
- AEHS在性能与收敛速度上均优于AE+A2C,尤其在高观察不完整度下表现更优,表明其数据效率更高。
- AEHS的加权重要性采样(WIS)回报的95%置信下界为7.030,而医生策略的经验回报为4.867,表明其具有强大的离策略性能。
- 由于采用最佳优先选择,后缀树中节点扩展数$N_s$的增加带来边际收益递减,表明探索效率高。
- 前瞻策略$\hat{\pi}$的更新更稳定且早于目标策略$\pi$,并通过提供更优的价值目标,加速了$\pi$的学习。
- 启发式引导的树扩展提升了价值函数近似的准确性,从而加快收敛并优化策略性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。