Skip to main content
QUICK REVIEW

[論文レビュー] A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning

Taiyu Zhu, Kezhi Li|arXiv (Cornell University)|Oct 9, 2019
Diabetes Management and Research参考文献 24被引用数 9
ひとこと要約

本論文は、深層強化学習を用いた二重拡張再帰ニューラルネットワーク(DRNN)を用いて訓練されたQ学習の変種を用い、1型糖尿病に対する二ホルモン閉ループインスリンおよびグルカゴン投与システムを提案する。この手法は、シミュレーション上、成人では93%、思春期では83%の時間範囲内(TIR)を達成し、自己対戦と重要度サンプリングを通じて個別化されたホルモン投与戦略を学習することで、従来の手法を著しく上回る。

ABSTRACT

We propose a dual-hormone delivery strategy by exploiting deep reinforcement learning (RL) for people with Type 1 Diabetes (T1D). Specifically, double dilated recurrent neural networks (RNN) are used to learn the hormone delivery strategy, trained by a variant of Q-learning, whose inputs are raw data of glucose \& meal carbohydrate and outputs are dual-hormone (insulin and glucagon) delivery. Without prior knowledge of the glucose-insulin metabolism, we run the method on the UVA/Padova simulator. Hundreds days of self-play are performed to obtain a generalized model, then importance sampling is adopted to customize the model for personal use. \emph{In-silico} the proposed strategy achieves glucose time in target range (TIR) $93\%$ for adults and $83\%$ for adolescents given standard bolus, outperforming previous approaches significantly. The results indicate that deep RL is effective in building personalized hormone delivery strategy for people with T1D.

研究の動機と目的

  • 深層強化学習を用いて、1型糖尿病に対する個別化・適応型ホルモン投与戦略を開発すること。
  • 限られた医療用強化学習データと個々の被験者間での高い生理的ばらつきという課題を克服すること。
  • グルコースおよび食事データに基づき、動的かつリアルタイムな二ホルモン(インスリンおよびグルカゴン)投与を可能にすることで、血糖コントロールを改善すること。
  • シミュレートされたデータで事前学習した一般化された深層RLモデルを、個人のデータを用いて微調整することで、個別化されたモデルを構築すること。
  • 既存の制御アルゴリズムと比較して、優れた時間範囲内(TIR)と低血糖・高血糖の低減を達成すること。

提案手法

  • 二重拡張再帰ニューラルネットワーク(DRNN)を用いて、グルコース値、食事炭水化物、ボラスインスリンなど多次元時系列入力を処理する。
  • 時間範囲内(TIR)、低血糖、高血糖に基づく報酬関数を用いた、深層Qネットワーク(DQN)の変種である強化学習でモデルを訓練する。
  • 二段階のフレームワークを採用:まず、UVA/Padovaシミュレータで数日分の自己対戦による一般化モデルを学習し、次に個人の患者データを用いた重要度サンプリングでモデルを個別化する。
  • 行動空間は5分ごとの基礎インスリンおよびグルカゴン投与速度から成り、Qネットワークから導出される確率的方策によって決定される。
  • 学習の安定性と収束性を向上させるために、優先順位付き経験再生とターゲットネットワークの更新を用いる。
  • 最終的なモデルは、6か月間の期間、10名の成人および10名の中高生被験者を用いて、イン・シミュラト・評価が行われた。

実験結果

リサーチクエスチョン

  • RQ1グルコース-インスリン代謝に関する事前の知識なしに、深層強化学習が1型糖尿病に対して二ホルモン(インスリンおよびグルカゴン)投与戦略を効果的に学習できるか?
  • RQ2シミュレートされたデータで事前学習した一般化された深層RLモデルが、限られた個人データを用いて効果的に個別化可能か?
  • RQ3提案手法が、既存の単一および二ホルモン制御システムと比較して、顕著に優れた時間範囲内(TIR)と血糖変動の低減を達成できるか?
  • RQ4拡張RNNの使用が、標準的なRNNやCNNと比較して、グルコース管理における長期的時間的依存性のモデリングを改善できるか?
  • RQ5自己対戦による事前学習と重要度サンプリングの組み合わせが、RLベースの医療エージェントの個別化に実用的かつ安全な手法であるか?

主な発見

  • 提案された二ホルモン閉ループシステムは、成人被験者において93.12%の時間範囲内(TIR)を達成し、一定の基礎インスリンを投与するベースラインボラス計算機と比較して11.21%の改善を示した(p ≤ 0.005)。
  • 思春期被験者では、TIRが83.39%に達し、ベースライン(61.68%)およびBC+IS+CR制御器(74.55%)を著しく上回った。
  • 低血糖発生率は成人で1.25%、思春期で2.10%に低下し、安全性の向上を示した。
  • 高血糖は成人で5.63%、思春期で14.51%に低下し、全体的な血糖コントロールの向上を示した。
  • 拡張RNNベースのモデルは、標準的なCNNやLSTMアーキテクチャと比較して、安定したグルコースレベルの維持とTIRの最大化において優れた性能を示した。
  • 重要度サンプリングにより、再訓練を一切行わず、個人の患者データのみを用いて事前学習された一般化モデルの効果的な個別化が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。