Skip to main content
QUICK REVIEW

[论文解读] Dynamic Measurement Scheduling for Event Forecasting using Deep RL

Chun‐Hao Chang, Mingjie Mai|arXiv (Cornell University)|Jan 24, 2019
Machine Learning in Healthcare参考文献 37被引用 6
一句话总结

本文提出了一种基于深度强化学习(DRL)的框架,用于在重症监护中实现动态、成本效益高的检测安排,联合优化预测性能与检测成本。在MIMIC-III数据集上的评估显示,使用LSTM网络训练的双值深度Q网络(dueling DQN)能够学习到自适应的、患者特异的检测安排策略,相比医生实践,检测频率降低31%,或预测增益提升300%。

ABSTRACT

Imagine a patient in critical condition. What and when should be measured to forecast detrimental events, especially under the budget constraints? We answer this question by deep reinforcement learning (RL) that jointly minimizes the measurement cost and maximizes predictive gain, by scheduling strategically-timed measurements. We learn our policy to be dynamically dependent on the patient's health history. To scale our framework to exponentially large action space, we distribute our reward in a sequential setting that makes the learning easier. In our simulation, our policy outperforms heuristic-based scheduling with higher predictive gain and lower cost. In a real-world ICU mortality prediction task (MIMIC3), our policies reduce the total number of measurements by $31\%$ or improve predictive gain by a factor of $3$ as compared to physicians, under the off-policy policy evaluation.

研究动机与目标

  • 通过开发数据驱动的、动态的检测安排系统,解决重症监护中冗余实验室检测带来的高成本和低效率问题。
  • 在最小化检测成本的同时,最大化对ICU死亡等不良事件的预测准确性。
  • 构建一个可扩展的强化学习框架,能够处理临床检测安排中典型的大型序列动作空间。
  • 使用真实世界ICU数据中的离策略评估(off-policy evaluation),将学习到的策略与医生实践和随机基线进行比较。
  • 提供临床可解释的、随患者病史和病情变化而动态演化的自适应检测安排策略。

提出的方法

  • 采用两级框架:首先,使用长短期记忆网络(LSTM)从不规则、随时间变化的电子健康记录(EHR)数据中建模患者状态,并预测事件概率(如死亡率)。
  • 其次,使用双值深度Q网络(DQN)通过最大化预测增益和最小化检测成本,学习动态检测安排策略。
  • DQN智能体将LSTM隐藏状态(总结患者历史)和独热编码的先前检测结果作为输入,实现上下文感知的决策。
  • 采用序列动作设置以管理指数级增长的动作空间,使智能体能够逐个决定检测项目,提升训练稳定性。
  • 通过在每次检测后预测事件概率的变化进行奖励塑造,实现即时反馈,相比稀疏事件奖励更易于训练。
  • 使用离策略策略评估(OPPE)在不需在线部署的情况下,将学习到的策略与医生和随机基线进行比较。

实验结果

研究问题

  • RQ1深度强化学习智能体能否学习到一种动态检测安排策略,在重症监护环境中提升预测性能的同时降低检测成本?
  • RQ2在真实世界ICU数据中,学习到的DRL策略与医生指导及随机检测安排相比,性能如何?
  • RQ3DRL智能体在多大程度上能根据患者病情演变和既往检测结果自适应调整其检测策略?
  • RQ4序列动作设置是否能有效将该框架扩展至临床实验室检测安排中典型的大型动作空间?
  • RQ5该框架能否在不规则采样和高维特征的真实世界数据中保持临床相关性并实现良好泛化?

主要发现

  • 在MIMIC-III ICU数据集中,基于DRL的检测安排策略相比医生实践,总检测次数减少了31%,同时保持或提升了预测性能。
  • 在离策略评估中,同一策略相比医生策略,预测增益(信息增益)提高了300%。
  • 学习到的策略表现出自适应行为:在无近期数据时安排更多检测,而在有近期检测结果时减少采样,符合临床直觉。
  • 序列DQN框架成功处理了潜在实验室检测项目的大型动作空间,实现了可扩展且稳定的训练。
  • 定性分析表明,智能体优先安排临床相关检测,如乳酸和肌酐,尤其在病情恶化患者中表现明显。
  • 在模拟中,该框架即使在底层分类器近乎完美时,也优于启发式检测规则,展现出鲁棒性和策略性学习能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。