[论文解读] A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning
本文提出了一种基于深度强化学习的双激素闭环胰岛素与胰岛素样多肽(glucagon)输注系统,用于1型糖尿病治疗,采用双膨胀循环神经网络(DRNN)进行训练,方法基于Q-learning的变体。该方法在模拟环境中实现了成人93%的血糖目标范围时间(TIR),青少年83%,显著优于以往方法,通过自我对弈和重要性采样学习个性化激素输注策略。
We propose a dual-hormone delivery strategy by exploiting deep reinforcement learning (RL) for people with Type 1 Diabetes (T1D). Specifically, double dilated recurrent neural networks (RNN) are used to learn the hormone delivery strategy, trained by a variant of Q-learning, whose inputs are raw data of glucose \& meal carbohydrate and outputs are dual-hormone (insulin and glucagon) delivery. Without prior knowledge of the glucose-insulin metabolism, we run the method on the UVA/Padova simulator. Hundreds days of self-play are performed to obtain a generalized model, then importance sampling is adopted to customize the model for personal use. \emph{In-silico} the proposed strategy achieves glucose time in target range (TIR) $93\%$ for adults and $83\%$ for adolescents given standard bolus, outperforming previous approaches significantly. The results indicate that deep RL is effective in building personalized hormone delivery strategy for people with T1D.
研究动机与目标
- 通过深度强化学习开发一种个性化、自适应的1型糖尿病激素输注策略。
- 克服医疗强化学习数据有限且昂贵,以及个体间生理差异大的挑战。
- 通过基于葡萄糖和进餐数据的动态实时双激素(胰岛素与胰高血糖素)输注,改善血糖控制。
- 创建一个在模拟数据上预训练的通用深度强化学习模型,然后利用个体患者数据进行微调。
- 与现有控制算法相比,实现更优的血糖目标范围时间(TIR)并减少低血糖与高血糖事件。
提出的方法
- 使用双膨胀循环神经网络(DRNN)处理多维时间序列输入,包括葡萄糖水平、进餐碳水化合物和 bolus 胰岛素。
- 模型采用基于目标范围时间(TIR)、低血糖和高血糖的奖励函数,通过深度Q网络(DQN)的变体进行训练。
- 采用两步框架:首先,在UVA/Padova模拟器中通过数百天的自我对弈训练通用模型;其次,利用重要性采样技术,基于个体患者数据对模型进行个性化。
- 动作空间由每五分钟一次的基础胰岛素和胰高血糖素输注速率组成,由Q网络推导出的随机策略决定。
- 训练过程中使用优先经验回放和目标网络更新,以提高学习稳定性和收敛性。
- 最终模型在模拟环境中对10名成人和10名青少年受试者进行了为期6个月的评估。
实验结果
研究问题
- RQ1深度强化学习能否在不了解葡萄糖-胰岛素代谢机制的前提下,有效学习1型糖尿病的双激素(胰岛素与胰高血糖素)输注策略?
- RQ2在模拟数据上预训练的通用深度强化学习模型,能否利用有限的个体患者数据实现有效个性化?
- RQ3所提出的方法是否在血糖目标范围时间(TIR)和血糖变异性方面显著优于现有单激素与双激素控制体系?
- RQ4与标准RNN或CNN相比,膨胀RNN是否能改善葡萄糖管理中的长期时间依赖性建模?
- RQ5自我对弈预训练与重要性采样相结合,是否是一种可行且安全的用于个性化强化学习医疗代理的方法?
主要发现
- 所提出的双激素闭环系统在成人受试者中实现了93.12%的血糖目标范围时间(TIR),相比使用恒定基础胰岛素的基线 bolus 计算器提高了11.21%(p ≤ 0.005)。
- 在青少年受试者中,系统实现了83.39%的TIR,显著优于基线(61.68%)和BC+IS+CR控制器(74.55%)。
- 该模型将低血糖发生率降低至成人的1.25%和青少年的2.10%,表明安全性显著提升。
- 系统将高血糖发生率降低至成人的5.63%和青少年的14.51%,表明整体血糖控制更优。
- 基于膨胀RNN的模型在维持稳定血糖水平和最大化TIR方面优于标准CNN和LSTM架构。
- 重要性采样技术实现了仅使用个体患者数据即可对预训练的通用模型进行有效个性化,无需从头开始重新训练,同时达到高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。