Skip to main content
QUICK REVIEW

[논문 리뷰] Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning

Taylor W. Killian, Sonali Parbhoo|arXiv (Cornell University)|2023. 01. 13.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 분포 기반 사망점 탐지(DistDeD)를 제안하며, 탐색이 불가능하고 데이터가 제한된 안전 중심 오프라인 강화학습 환경에서 최악의 결과를 식별하기 위한 위험 감수성 프레임워크이다. 이는 예상 수익의 전체 분포를 모델링하여 고위험 의사결정 지점의 조기이고 조정 가능한 탐지가 가능하게 한다. DistDeD는 이전 방법보다 평균적으로 10시간 일찍 사망점을 탐지하고, 중환자실(ICU) 환자 위험 평가에서 탐지율을 20% 향상시킨다.

ABSTRACT

In safety-critical decision-making scenarios being able to identify worst-case outcomes, or dead-ends is crucial in order to develop safe and reliable policies in practice. These situations are typically rife with uncertainty due to unknown or stochastic characteristics of the environment as well as limited offline training data. As a result, the value of a decision at any time point should be based on the distribution of its anticipated effects. We propose a framework to identify worst-case decision points, by explicitly estimating distributions of the expected return of a decision. These estimates enable earlier indication of dead-ends in a manner that is tunable based on the risk tolerance of the designed task. We demonstrate the utility of Distributional Dead-end Discovery (DistDeD) in a toy domain as well as when assessing the risk of severely ill patients in the intensive care unit reaching a point where death is unavoidable. We find that DistDeD significantly improves over prior discovery approaches, providing indications of the risk 10 hours earlier on average as well as increasing detection by 20%.

연구 동기 및 목표

  • 탐색이 불가능하고 데이터가 제한된 안전 중심 오프라인 강화학습 환경에서 최악의 결과를 탐지하는 데 도전하는 것.
  • 이전의 사망점 탐지(DeD) 방법이 예상 수익의 점 추정치에 의존하여 과도하게 낙관적이거나 위험 분포를 포착하지 못하는 한계를 극복하는 것.
  • 수익 결과의 전체 분포를 모델링하여 조기이고 조정 가능하며 보수적인 위험 지표를 제공하는 프레임워크를 개발하는 것.
  • 특히 임상 및 산업 현장에서 불가역적인 악화가 발생하기 전에 인간 운영자가 수동으로 개입할 수 있도록 하는 것.

제안 방법

  • 이 방법은 분포 기반 강화학습(DeD)을 사용하여 각 상태에서의 행동에 대한 예상 수익의 전체 분포를 모델링하며, 점 추정치를 학습된 수익 분포로 대체한다.
  • 이 프레임워크는 수익 분포의 하위 꼬리, 특히 최악의 결과에 기반한 위험 감수성 측도를 계산하여 사망점으로 이어질 가능성이 있는 상태를 식별한다.
  • 작업에 따라 위험 수용 수준을 조정할 수 있는 조정 가능한 위험 임계값을 도입하여 보수적이거나 공격적인 탐지 전략을 가능하게 한다.
  • 이론적 기반을 제공하기 위해 위험 추정치가 원래 DeD 방법의 하한값임을 보여주며, 핵심 안전 보장을 유지하면서 민감도를 향상시킨다.
  • 이 방법은 사내 환경과 실제 중환자실 데이터셋에 적용되며, 온라인 상호작용 없이 오프라인 데이터셋을 사용해 모델을 훈련하고 평가한다.
  • 사망점 탐지는 특정 행동에 대한 최악의 수익 분포가 안전 임계값 이하로 떨어지는지 평가함으로써 수행되며, 이는 시스템 장애나 환자 악화의 즉각적 신호를 뜻한다.
Figure 1 : Illustration of the determination of conditional value at risk ( $\mathrm{CVaR}_{\alpha}$ ), with $\alpha=0.1$
Figure 1 : Illustration of the determination of conditional value at risk ( $\mathrm{CVaR}_{\alpha}$ ), with $\alpha=0.1$

실험 결과

연구 질문

  • RQ1예상 수익의 전체 분포를 모델링하면 안전 중심 오프라인 강화학습에서 최악의 결과를 조기에 탐지하는 데 개선이 가능한가?
  • RQ2점 추정치 기반 방법과 비교해 분포 기반 위험 추정은 불가역적 악화 이전에 사망점을 얼마나 더 잘 탐지하는가?
  • RQ3고위험 환경에서 신뢰성 유지 조건에서 다양한 위험 수용 수준에 맞게 이 프레임워크를 얼마나 조정할 수 있는가?
  • RQ4실제 임상 데이터에서 DistDeD는 기존 방법보다 시스템 장애나 환자 악화를 더 이르게 탐지할 수 있는가?

주요 결과

  • DistDeD는 중환자실 환자 모니터링에서 이전의 사망점 탐지 방법보다 평균적으로 10시간 일찍 고위험 시나리오를 탐지한다.
  • 기본 방법 대비 사망점의 탐지율을 20% 향상시켜 최악의 결과에 대한 민감도를 높였다.
  • 수익 전체 분포를 모델링함으로써 DistDeD는 임상 또는 산업 안전 요구사항에 맞게 맞춤화할 수 있는 조정 가능한 위험 감수성 프레임워크를 제공한다.
  • 분포 기반 접근에서 유도된 위험 추정치는 원래 DeD 방법의 이론적 하한값을 이룹니다. 이는 안전 보장을 유지함을 보장한다.
  • 합성 환경과 실제 중환자실 데이터 모두에서 DistDeD는 데이터가 제한되고 혼란스러운 상황에서도 환자 결과가 불가역적으로 악화될 가능성이 있는 상태를 성공적으로 식별했다.
  • 이 프레임워크는 온라인 탐색이 필요 없이 안전 중심 시스템에서 인간의 조기에 개입을 가능하게 하여 실용적인 의사결정 지원 도구로서의 유용성을 입증했다.
Figure 2 : Distributional Dead-end Discovery (DistDeD) a) Observations are encoded (as needed) into a state representation and then b) passed to independent IQN models to estimate the distribution of returns ( $Z_{D}$ and $Z_{R}$ ) for each possible action. c) The $\mathrm{CVaR}_{\alpha}$ is compute
Figure 2 : Distributional Dead-end Discovery (DistDeD) a) Observations are encoded (as needed) into a state representation and then b) passed to independent IQN models to estimate the distribution of returns ( $Z_{D}$ and $Z_{R}$ ) for each possible action. c) The $\mathrm{CVaR}_{\alpha}$ is compute

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.