[논문 리뷰] Risk-Averse Offline Reinforcement Learning
이 논문은 사전에 수집된 데이터만을 사용하여 위험 회피 정책을 최적화하는 최초의 모델 프리 오프라인 강화학습 알고리즘인 O-RAAC을 소개한다. 분포 기반 크리틱, CVaR 또는 기타 일관된 위험 측정 기준을 사용하는 위험 회피 액터, 그리고 부트스트랩 오차를 줄이기 위한 VAE 기반의 이mitation 구성 요소를 결합함으로써, O-RAAC는 MuJoCo 제어 과제에서 위험 회피 성능과 분포적 강건성을 뛰어나게 향상시켰으며, 특히 분포 이탈 상황에서 위험 중립 기반 알고리즘보다 뛰어난 성능을 보였다.
Training Reinforcement Learning (RL) agents in high-stakes applications might be too prohibitive due to the risk associated to exploration. Thus, the agent can only use data previously collected by safe policies. While previous work considers optimizing the average performance using offline data, we focus on optimizing a risk-averse criteria, namely the CVaR. In particular, we present the Offline Risk-Averse Actor-Critic (O-RAAC), a model-free RL algorithm that is able to learn risk-averse policies in a fully offline setting. We show that O-RAAC learns policies with higher CVaR than risk-neutral approaches in different robot control tasks. Furthermore, considering risk-averse criteria guarantees distributional robustness of the average performance with respect to particular distribution shifts. We demonstrate empirically that in the presence of natural distribution-shifts, O-RAAC learns policies with good average performance.
연구 동기 및 목표
- 탐색이 너무 비용이 많이 들기 때문에 고위험 응용 분야에서 위험 회피 오프라인 RL 알고리즘이 부족한 문제를 해결하기 위해.
- CVaR와 같은 위험 회피 성능 기준을 최적화하는 완전히 오프라인 알고리즘을 개발하여 분포 이탈에 대한 강건성을 확보하기 위해.
- 행위 정책 모델링을 위한 변동형 오토인코더(VAE)를 통합하여 오프라인 RL에서의 부트스트랩 오차를 줄이기 위해.
- 위험 회피 목표가 악성 상황 성능을 향상시키는 것 외에도 자연적인 분포 이탈 상황에서도 뛰어난 평균 성능을 유지할 수 있음을 입증하기 위해.
- CVaR, 0.25-CVaR, CPW와 같은 다양한 위험 측정 기준과 호환되는 일반적인 프레임워크를 제공하기 위해.
제안 방법
- 알고리즘은 은닉 분포를 가정하지 않는 한정된 수익 분포를 모델링하기 위해 암묵적 히스토그램 네트워크 기반의 분포 기반 크리틱을 사용한다.
- 위험 회피 액터는 조건부 가치의 위험(Conditional Value at Risk, CVaR)과 같은 수익 분포의 왜곡을 최적화하며, 미분 가능한 위험 기준을 사용한다.
- 행위 정책을 모델링하기 위해 변동형 오토인코더(VAE)를 훈련시켜 이터레이션 학습을 가능하게 하고 정책 업데이트에서의 분포 이탈을 줄인다.
- 액터는 VAE가 생성한 정책의 변형으로 파arameter화되어, 학습된 정책이 행위 정책에 가까워지며 과적합을 줄인다.
- 크리틱은 전체 수익 분포에 대한 분포 기반 벨먼 업데이트로 훈련되며, 액터는 위험 회피 정책 기반 경량 기반으로 업데이트된다.
- 이 방법은 완전히 오프라인으로, 온라인 환경 상호작용 없이 고정된 데이터 세트에 의존한다.
실험 결과
연구 질문
- RQ1완전히 오프라인 강화학습 알고리즘이 고위험 제어 과제에서 CVaR와 같은 위험 회피 성능 지표를 효과적으로 최적화할 수 있는가?
- RQ2오프라인 RL에서 위험 회피 기준을 사용하면 자연적인 데이터 분포 이탈에 대한 강건성이 향상되는가?
- RQ3VAE 기반의 이터레이션 구성 요소가 오프라인 위험 회피 RL에서 부트스트랩 오차를 어떻게 줄이는가?
- RQ4위험 회피 정책은 오프라인 환경에서 위험 중립 기반 알고리즘과 경쟁 가능한 평균 성능을 유지할 수 있는가?
- RQ5제안된 방법은 CVaR, 0.25-CVaR, CPW와 같은 다양한 위험 측정 기준으로 일반화 가능한가?
주요 결과
- 중간 데이터로 구성된 허프리지 환경에서 O-RAAC는 0.1-CVaR를 214 ± 36으로 기록하여 O-D4PG(66 ± 34)와 BEAR(15 ± 30)를 크게 앞섰다.
- 전문가 데이터로 구성된 워커-2D 환경에서 O-RAAC는 0.1-CVaR를 751 ± 154로 기록하여 O-D4PG(31 ± 29)와 BEAR(517 ± 66)를 앞섰다.
- 전문가 데이터로 구성된 허퍼 환경에서 O-RAAC는 0.1-CVaR를 1416 ± 28로 기록하여 O-D4PG(1008 ± 28)와 BEAR(1252 ± 47)를 크게 앞섰다.
- O-RAAC는 경쟁적인 평균 수익을 유지하여 허퍼(전문가)에서 1482 ± 4, 워커-2D(중간)에서 1282 ± 20를 기록했으며, O-D4PG와 BEAR와 같은 위험 중립 기반 알고리즘과 유사한 성능을 보였다.
- 분포 이탈이 발생하는 환경, 예를 들어 Hopper-E에서 O-RAAC는 정책을 안전한 영역에 중심화하여 데이터가 희박한 고위험 영역을 피하는 데 성공했고, O-D4PG는 위험 영역으로 과도하게 진입했다.
- VAE 구성 요소는 특히 저다양성 전문가 데이터 세트에서 부트스트랩 오차를 줄이는 데 기여했으며, 위험 회피 최적화가 더 큰 강건성을 제공함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.