Skip to main content
QUICK REVIEW

[논문 리뷰] Optimizing Medical Treatment for Sepsis in Intensive Care: from Reinforcement Learning to Pre-Trial Evaluation

Luchen Li, Ignacio Albert-Smet|arXiv (Cornell University)|2020. 03. 13.
Sepsis Diagnosis and Treatment참고 문헌 21인용 수 6
한 줄 요약

이 논문은 후행적 중환자실 데이터를 활용하여 강화학습 프레임워크인 AI Clinician II를 제안하여 중증화농 치료를 최적화한다. 환자 상태를 순환 신경망으로 모델링하고, 중요도 샘플링과 최선 우선 트리 탐색을 활용한 비정책 학습을 통해 분포 이탈을 완화하면서도 행동 복제를 통해 정책을 안정화시킨다. 이 방법은 오프-정책 평가에서 기준 정책보다 뛰어난 성능을 보이며, 인간이 참여하는 사전 임상 검증 프레임워크를 통해 안전하고 데이터 기반의 임상 적용을 가능하게 한다.

ABSTRACT

Our aim is to establish a framework where reinforcement learning (RL) of optimizing interventions retrospectively allows us a regulatory compliant pathway to prospective clinical testing of the learned policies in a clinical deployment. We focus on infections in intensive care units which are one of the major causes of death and difficult to treat because of the complex and opaque patient dynamics, and the clinically debated, highly-divergent set of intervention policies required by each individual patient, yet intensive care units are naturally data rich. In our work, we build on RL approaches in healthcare ("AI Clinicians"), and learn off-policy continuous dosing policy of pharmaceuticals for sepsis treatment using historical intensive care data under partially observable MDPs (POMDPs). POMPDs capture uncertainty in patient state better by taking in all historical information, yielding an efficient representation, which we investigate through ablations. We compensate for the lack of exploration in our retrospective data by evaluating each encountered state with a best-first tree search. We mitigate state distributional shift by optimizing our policy in the vicinity of the clinicians' compound policy. Crucially, we evaluate our model recommendations using not only conventional policy evaluations but a novel framework that incorporates human experts: a model-agnostic pre-clinical evaluation method to estimate the accuracy and uncertainty of clinician's decisions versus our system recommendations when confronted with the same individual patient history ("shadow mode").

연구 동기 및 목표

  • 후행적 데이터에서부터 prospective 임상 시험으로의 AI 기반 중증화농 치료 정책 전환을 안전하고 규제 준수 가능하도록 보장하는 강화학습 프레임워크 개발.
  • 중환자실에서 부분 관측 가능한 환자 상태 문제를 해결하기 위해 RNN과 변동형 오토인코더를 활용한 역사 의존적 상태 표현 모델링.
  • 행동 복제를 통해 학습된 정책가 행동 정책과의 거리 유지로 배치 이탈을 완화함으로써 배치 강화학습에서의 분포 이탈 문제 해결.
  • 미탐색 영역의 상태에서 가치 함수 확장을 위해 최선 우선 트리 탐색을 통합함으로써 행동 정책를 초월한 정책 최적화 향상.
  • 동일한 환자 역사를 기반으로 AI 및 임상의 결정을 직접 비교할 수 있도록, AI와 임상의의 의사결정 정확도 및 불확실성 측정을 가능하게 하는 모델에 종속되지 않는 사전 임상 평가 프레임워크 도입.

제안 방법

  • 과거 행동과 관측의 시퀀스를 처리하는 순환 신경망(RNN)을 활용해 역사 의존적 상태 표현으로 환자 상태를 모델링.
  • 미래 관측을 예측할 수 있는 상태 표현을 학습하기 위해 조건부 변동형 오토인코더(CVAE)를 도입하여 상태 인코더의 지도 학습을 가능하게 함.
  • 행동 정책의 전이를 재가중하기 위해 중요도 샘플링(IS)을 활용한 비정책 강화학습을 구현하며, 액터-크리틱 아키텍처를 적용.
  • 추론 시점에 액터-크리틱 모델의 가치 추정치에 따라 행동 정책의 커버리지 외부의 고가치 상태 영역을 탐색하기 위해 최선 우선 트리 탐색을 적용.
  • 각 훈련 배치 내에서 중요도 샘플링 가중치를 정규화하고, 가중치 붕괴를 방지하기 위한 정규화를 적용함으로써 정책 평가의 분산을 감소.
  • 임상의가 동일한 환자 역사를 기반으로 AI 추천을 '샤로우 모드'에서 평가하는 모델에 종속되지 않는 사전 임상 평가 프레임워크를 도입하여, AI와 임상의의 의사결정 정확도 및 불확실성 간 직접 비교 가능.

실험 결과

연구 질문

  • RQ1후행적 중환자실 데이터를 기반으로 학습된 강화학습 정책이 중증화농 관리에서 기존 임상의 치료 정책을 뛰어넘을 수 있는가?
  • RQ2RNN 기반 상태 표현을 활용한 역사 의존적 부분 관측 가능 마르코프 결정 과정(POMDP) 프레임워크는 중증화농에서 복잡한 환자 역학을 얼마나 잘 포착할 수 있는가?
  • RQ3최선 우선 트리 탐색을 통합함으로써 비정책 학습만으로는 달성할 수 없는 정책 성능 향상은 어느 정도 이루어지는가?
  • RQ4임상 환경에서 배치 강화학습의 분포 이탈 문제를 어떻게 완화할 수 있는가? 이를 통해 안전성과 정책 신뢰성 확보는 어떻게 이룰 수 있는가?
  • RQ5인간이 참여하는 사전 임상 평가 프레임워크는 AI와 임상의의 의사결정을 비교하기 위한 신뢰성 있고 위험을 고려한 기준을 제공할 수 있는가?

주요 결과

  • AI Clinician II는 가중 중요도 샘플링, Retrace(λ), 가중 이중 안정성 추정 등 다양한 오프-정책 평가(OPE) 방법에서 행동 정책 및 AI Clinician I를 뛰어넘는 성능을 보였다.
  • 제거 실험 결과, 학습된 상태 표현과 트리 탐색 구성 요소가 최적 성능을 달성하는 데 필수적이며, 각각 독립적으로 정책 성과 향상에 기여함을 확인.
  • 모델에 종속되지 않는 사전 임상 평가 프레임워크는 임상의와 AI 시스템 간 의사결정 정확도 및 불확실성의 차이를 성공적으로 포착하여 안전하고 비교 가능한 벤치마킹을 가능하게 했다.
  • 학습 목표에 행동 복제를 통합함으로써 분포 이탈이 효과적으로 감소하였으며, 정책이 임상적으로 타당한 상태 분포 내에 머무르도록 보장하였다.
  • 배치 정규화와 중요도 샘플링 가중치 정규화를 통한 중요도 샘플링은 오프-정책 평가의 안정성과 신뢰성을 크게 향상시켰다.
  • 상태 표현 학습을 위해 CVAE를 사용함으로써 정책 최적화가 완전히 수렴하지 않은 상태에서도 더 정확한 상태 추론이 가능해졌으며, 이는 전체 훈련 효율성과 성능 향상에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.