Skip to main content
QUICK REVIEW

[논문 리뷰] Sample-Based Bounds for Coherent Risk Measures: Applications to Policy Synthesis and Verification

Prithvi Akella, Anushri Dixit|arXiv (Cornell University)|2022. 04. 21.
Health Systems, Economic Evaluations, Quality of Life인용 수 4
한 줄 요약

이 논문은 불확실한 로봇 시스템에서 고신뢰도의 위험 인식 검증 및 정책 합성 가능성을 보장하기 위해 $g$-엔트로픽 위험 측정치에 대한 표본 기반 경계를 제안한다. 농도 불확실성과 표본 기반 최적화를 활용함으로써, 이 방법은 99%의 신뢰도로 99퍼센트의 대안보다 우수한 성능을 보이는 정책을 식별한다. 시뮬레이션을 통해 다중 에이전트 시스템에서 검증되었으며, 위험 인식 제어기가 기준선 대비 뛰어난 성능을 보였다.

ABSTRACT

The dramatic increase of autonomous systems subject to variable environments has given rise to the pressing need to consider risk in both the synthesis and verification of policies for these systems. This paper aims to address a few problems regarding risk-aware verification and policy synthesis, by first developing a sample-based method to bound the risk measure evaluation of a random variable whose distribution is unknown. These bounds permit us to generate high-confidence verification statements for a large class of robotic systems. Second, we develop a sample-based method to determine solutions to non-convex optimization problems that outperform a large fraction of the decision space of possible solutions. Both sample-based approaches then permit us to rapidly synthesize risk-aware policies that are guaranteed to achieve a minimum level of system performance. To showcase our approach in simulation, we verify a cooperative multi-agent system and develop a risk-aware controller that outperforms the system's baseline controller. We also mention how our approach can be extended to account for any $g$-entropic risk measure - the subset of coherent risk measures on which we focus.

연구 동기 및 목표

  • 기본 분포가 알려지지 않은 상황에서 $g$-엔트로픽 위험 측정치에 대한 표본 기반 경계를 개발하여 위험 인식 검증 및 정책 합성을 가능하게 한다.
  • 불확실한 시스템에서 위험 측정치에 대한 고신뢰도 상한 경계를 생성하기 위한 기본 표본 크기 요구 조건을 설정한다.
  • 위험 인식 검증 문제를 표본 기반 경계를 활용한 위험 측정치 식별 문제로 재정의한다.
  • 표본 기반 최적화 접근법을 개발하여 결정 공간의 대부분의 정책보다 뛰어난 성능을 보이는 정책을 고신뢰도로 식별한다.
  • 협동 다중 에이전트 시스템에서 방법을 검증하여, 기준선 제어기 대비 위험 인식적으로 향상된 성능을 입증한다.

제안 방법

  • 독립 동일분포(i.i.d.) 표본에서의 경험 위험 추정을 활용하여 $g$-엔트로픽 위험 측정치에 대한 농도 불확실성 불등식을 유도한다.
  • Hoeffding 유형의 불등식을 적용하여 위험 측정치 평가의 상단 尾(꼬리)를 고확률로 경계한다.
  • 시스템 궤적에서 유도된 랜덤 변수의 위험 측정치 추정 문제로 위험 인식 검증 문제를 재정의한다.
  • 표본 기반 최적화를 사용하여 $N \geq 459$개의 표본 파rameter 기반으로 99번째 백분위수 성능을 보장하는 정책을 식별한다.
  • 불확실성 하에서의 시스템 성능를 평가하기 위해 $p$가 제어기의 파라미터가 되는 강건성 측정치 $\rho(\mathbf{x}^{\theta,p})$를 활용한다.
  • 비볼록 최적화 문제의 목적 함수로 표본 기반 위험 경계를 통합하여 정책 합성에 활용한다.

실험 결과

연구 질문

  • RQ1기본 분포가 알려지지 않은 상황에서 $g$-엔트로픽 위험 측정치에 대한 고신뢰도 상한 경계를 생성하기 위해 필요한 최소 표본 수는 얼마인가?
  • RQ2표본 기반 경계를 사용하여 위험 인식 시스템 성능에 대한 고신뢰도 검증 문장을 생성할 수 있는가?
  • RQ3표본 기반 방법은 어떻게 결정 공간의 대부분의 정책보다 뛰어난 성능을 보이는 위험 인식 최적화 정책을 식별할 수 있는가?
  • RQ4제안된 방법을 사용하여 대부분의 대안보다 위험 인식적으로 뛰어난 성능을 보이는 제어기를 증명 가능하게 합성할 수 있는가?
  • RQ5기존의 검증 방법과 비교했을 때 표본 기반 경계는 타이트함과 보수성 측면에서 어떻게 다른가?

주요 결과

  • $N_{\mathcal{R}} = 149$개의 표본으로, $\alpha = 0.1$일 때 복수의 강건성에 대한 CVaR에 대해 95% 신뢰도 상한 경계 $-0.1489$를 생성하였으며, 이는 고신뢰도 성능 검증을 보장한다.
  • $\operatorname{\mathcal{R}}(p_i, 0.95, 0.1) = -0.1489$로 상한 경계가 도출된 제어기 파라미터 집합 $p_i$가 확인되었으며, 이는 99% 신뢰도로 99번째 백분위수 성능을 확보함을 의미한다.
  • 그림 10에 나타낸 바와 같이, 위험 인식 제어기는 기준선 로봇아리움 제어기보다 강건성 분포에서 뛰어난 성능을 보였으며, 이는 위험 인식적으로 향상된 성능을 확인한다.
  • 99번째 백분위수 성능을 99%의 신뢰도로 식별하기 위해 $N \geq 459$개의 표본이 필요하며, 이는 추론 9에서 유도되었다.
  • 이론적 경계는 수치적으로 검증되었으며, 표본 기반 농도 불확실성 불등식과 최적화 프레임워크의 정확성이 확인되었다.
  • 이 방법은 기초 불확실성 분포에 대한 사전 지식이 없어도 체계적인 위험 인식 검증 및 정책 합성을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.