Skip to main content
QUICK REVIEW

[논문 리뷰] A Dual-Hormone Closed-Loop Delivery System for Type 1 Diabetes Using Deep Reinforcement Learning

Taiyu Zhu, Kezhi Li|arXiv (Cornell University)|2019. 10. 09.
Diabetes Management and Research참고 문헌 24인용 수 9
한 줄 요약

이 논문은 심층 강화학습을 사용한 이중 확장 순환 신경망(DRNN)을 활용한 이중 호르몬(인슐린 및 글루카곤) 폐쇄형 투여 시스템을 제안한다. 이 시스템은 유형 1 당뇨병 환자를 대상으로 하며, Q-학습의 변종을 통해 훈련된다. 시뮬레이션 결과 성인 환자에서 93%의 시간 범위 내 머무름(TIR), 청소년 환자에서 83%의 TIR를 달성하여 기존 방법보다 뚜렷이 뛰어나며, 자기 연습과 중요도 샘플링을 통해 개인화된 호르몬 투여 전략을 학습한다.

ABSTRACT

We propose a dual-hormone delivery strategy by exploiting deep reinforcement learning (RL) for people with Type 1 Diabetes (T1D). Specifically, double dilated recurrent neural networks (RNN) are used to learn the hormone delivery strategy, trained by a variant of Q-learning, whose inputs are raw data of glucose \& meal carbohydrate and outputs are dual-hormone (insulin and glucagon) delivery. Without prior knowledge of the glucose-insulin metabolism, we run the method on the UVA/Padova simulator. Hundreds days of self-play are performed to obtain a generalized model, then importance sampling is adopted to customize the model for personal use. \emph{In-silico} the proposed strategy achieves glucose time in target range (TIR) $93\%$ for adults and $83\%$ for adolescents given standard bolus, outperforming previous approaches significantly. The results indicate that deep RL is effective in building personalized hormone delivery strategy for people with T1D.

연구 동기 및 목표

  • 심층 강화학습을 사용하여 유형 1 당뇨병 환자에게 개인화되고 적응 가능한 호르몬 투여 전략을 개발한다.
  • 의료 강화학습 데이터의 제한성과 높은 비용, 개인 간 생리적 변동성의 과제를 극복한다.
  • 혈액 포도당 수치와 식사 데이터를 기반으로 실시간으로 동적 이중 호르몬(인슐린 및 글루카곤) 투여를 가능하게 하여 혈당 조절을 향상시킨다.
  • 시뮬레이션된 데이터로 사전 훈련된 일반화된 심층 RL 모델을 개발한 후, 개인의 데이터를 사용하여 보정한다.
  • 기존 제어 알고리즘보다 뛰어난 시간 범위 내 머무름(TIR)과 저하된 저혈당/고혈당을 달성한다.

제안 방법

  • 다양한 시간적 입력(혈액 포도당 수치, 식사 탄수화물, 보루스 인슐린 등)을 처리하기 위해 이중 확장 순환 신경망(DRNN)을 사용한다.
  • 시간 범위 내 머무름(TIR), 저혈당, 고혈당을 기반으로 한 보상 함수를 사용한 심층 Q-네트워크(DQN)의 변종 강화학습을 통해 모델을 훈련한다.
  • 이중 단계 프레임워크를 적용한다: 첫째, UVA/Padova 시뮬레이터에서 수백 일에 걸친 자기 연습을 통해 일반화된 모델을 훈련한다; 둘째, 개인 환자 데이터를 사용한 중요도 샘플링을 통해 모델을 개인화한다.
  • 행동 공간은 5분 간격의 기저 인슐린 및 글루카곤 투여 속도로 구성되며, Q-네트워크에서 유도된 확률적 정책에 의해 결정된다.
  • 학습 과정에서 우선순위 경험 재현 및 타겟 네트워크 업데이트를 사용하여 학습 안정성과 수렴성을 향상시킨다.
  • 최종 모델은 6개월 간의 시뮬레이션 기간 동안 10명의 성인 및 10명의 청소년 환자에서 평가된다.

실험 결과

연구 질문

  • RQ1심층 강화학습이 포도당-인슐린 대사에 대한 사전 지식 없이도 이중 호르몬(인슐린 및 글루카곤) 투여 전략을 효과적으로 학습할 수 있는가?
  • RQ2시뮬레이션된 데이터로 사전 훈련된 일반화된 심층 RL 모델이 제한된 개인 데이터를 사용해 효과적으로 개인 맞춤화될 수 있는가?
  • RQ3제안된 방법이 기존의 단일 및 이중 호르몬 제어 시스템보다 유의미하게 높은 시간 범위 내 머무름(TIR)과 낮은 혈당 변동성을 달성할 수 있는가?
  • RQ4확장된 RNN의 사용이 표준 RNN 또는 CNN보다 포도당 관리에서 장기적 시간 의존성 모델링을 향상시킬 수 있는가?
  • RQ5자기 연습 사전 훈련과 중요도 샘플링의 조합이 심층 강화학습 기반 의료 에이전트의 개인 맞춤화에 실현 가능하고 안전한 접근인가?

주요 결과

  • 제안된 이중 호르몬 폐쇄형 시스템은 성인 환자에서 평균 93.12%의 시간 범위 내 머무름(TIR)을 달성하였으며, 기준값인 일정 기저 인슐린 투여를 위한 보루스 계산기 대비 11.21% 향상되었다(p ≤ 0.005).
  • 청소년 환자에서는 TIR가 83.39%로 기준값(61.68%)과 BC+IS+CR 제어기(74.55%)를 뛰어넘었다.
  • 저혈당 발생률은 성인에서 1.25%로 감소하여 안전성 향상을 보였다.
  • 고혈당 발생률은 성인에서 5.63%, 청소년에서 14.51%로 감소하여 전반적인 혈당 조절 향상을 나타냈다.
  • 확장된 RNN 기반 모델은 표준 CNN 및 LSTM 아키텍처보다 안정된 포도당 수치 유지와 TIR 최대화에서 뛰어난 성능을 보였다.
  • 중요도 샘플링을 통해 사전 훈련된 일반화된 모델을 개인 환자 데이터만으로 효과적으로 개인화하였으며, 재학습 없이도 높은 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.