Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Robustness via Risk Averse Distributional Reinforcement Learning

Rahul Singh, Qinsheng Zhang|arXiv (Cornell University)|2020. 05. 01.
Reinforcement Learning in Robotics참고 문헌 33인용 수 8
한 줄 요약

이 논문은 표본 기반 분포 강화 학습 정책 그래디언트 프레임워크 내에서 조건부가치의 위험도(Conditional Value at Risk, CVaR)를 최적화하여 연속 제어 과제에서 정책의 강건성과 안정성을 향상시키는 위험 회피 분포 강화 학습 알고리즘, 위험 회피 SDPG를 제안한다. 이 방법은 BipedalWalker, HalfCheetah, Walker2d 환경에서 모델 불확실성과 동작 외란 상황에서도 위험 중립 정책보다 뛰어난 성능을 보이며, 노이즈가 많거나 완벽하지 않은 실제 환경 구현에서 더 높은 안정성과 신뢰성을 확보한다.

ABSTRACT

One major obstacle that precludes the success of reinforcement learning in real-world applications is the lack of robustness, either to model uncertainties or external disturbances, of the trained policies. Robustness is critical when the policies are trained in simulations instead of real world environment. In this work, we propose a risk-aware algorithm to learn robust policies in order to bridge the gap between simulation training and real-world implementation. Our algorithm is based on recently discovered distributional RL framework. We incorporate CVaR risk measure in sample based distributional policy gradients (SDPG) for learning risk-averse policies to achieve robustness against a range of system disturbances. We validate the robustness of risk-aware SDPG on multiple environments.

연구 동기 및 목표

  • 모델 불확실성과 외부 외란으로 인해 시뮬레이션에서 학습된 정책과 실제 환경 적용 간의 강건성 격차를 해결하기 위해.
  • 분포 강화 학습에 위험 민감 기준을 통합하여 연속 제어 과제에서 정책의 강건성을 향상시키기 위해.
  • SDPG 내에서 표본 기반 수익 분포 표현을 활용하여 효율적이고 효과적인 위험 회피 정책 학습을 가능하게 하기 위해.
  • 다양한 수준의 동작 힘 외란 상황에서 여러 OpenAI Gym 환경에서 제안된 방법의 강건성을 경험적으로 검증하기 위해.

제안 방법

  • 이 방법은 표본 기반 분포 정책 그래디언트(SDPG) 프레임워크를 확장하여 악성 성과에 대비한 최악의 성능을 최적화하기 위해 조건부가치의 위험도(CVaR)를 위험 측정 기준으로 통합한다.
  • 이러한 방식은 이산 카테고리 또는 분위수 표현이 아닌 표본화된 수익을 사용하여 수익 분포를 모델링함으로써, 민감도가 높고 효율적인 위험 민감 최적화를 가능하게 한다.
  • 정책은 특정 CVaR 수준 α 하에서의 기대 수익을 최대화하도록 학습되며, 이는 수익 분포의 꼬리 부분에 집중하고 희귀하지만 치명적인 결과에 대한 민감도를 감소시킨다.
  • 알고리즘은 CVaR의 미분 가능한 근사치를 사용하여 SDPG 프레임워크 내에서 정책 그래디언트 방법을 통해 종단 간 훈련을 가능하게 한다.
  • 외란은 평가 중에 동작 힘에 평균 0인 가우시안 노이즈를 추가하여 시뮬레이션되며, 노이즈 수준은 0에서 1.5×a_max까지 다양하게 설정된다. 이는 실제 액추에이터의 비완벽성을 모방한다.
  • 각 환경에서 1000개의 트레이젝터리에 걸쳐 성능을 평가하고, 수익의 누적분포함수(CDF)를 보고하여 꼬리 행동과 강건성을 분석한다.

실험 결과

연구 질문

  • RQ1분포 강화 학습 프레임워크에 CVaR를 통합함으로써 연속 제어 과제에서 동작 외란에 대한 정책의 강건성이 향상되는가?
  • RQ2모델 불확실성이 증가함에 따라 위험 회피 SDPG는 위험 중립 SDPG에 비해 성능 안정성에서 어떻게 다를까?
  • RQ3CVaR 최적화는 시뮬레이션에서 실제 환경으로의 전이 시나리오에서 더 나은 일반화와 신뢰성을 이끌어내는가?
  • RQ4다양한 CVaR α 수준은 고분산·위험도가 높은 환경에서 기대 수익과 강건성 간의 트레이드오프에 어떻게 영향을 미치는가?

주요 결과

  • HalfCheetah-v2 환경에서 α = 0.1인 위험 회피 SDPG 정책이 모든 노이즈 수준에서 최고의 성능을 기록했으며, 위험 중립 정책과 다른 CVaR 설정보다 뛰어난 성능을 보였다.
  • BipedalWalker-v2에서 비영점 α 값으로 학습된 정책는 모든 노이즈 수준에서 위험 중립 정책보다 뛰어난 성능을 보였으며, 노이즈가 증가함에 따라 성능 저하 속도가 현저히 느렸다.
  • Walker2d-v2에서 α = 0.5인 정책가 가장 높은 강건성을 보였으며, 고노이즈(1.5×a_max) 조건에서도 안정된 성능을 유지했다. 반면 위험 중립 정책는 외란에 가장 민감했다.
  • CDF 분석 결과, 위험 회피 정책는 낮은 수익 영역에서 더 두꺼운 꼬리를 보이며, 불확실성 하에서 치명적인 실패의 가능성이 감소함을 확인했다.
  • 제안된 방법은 위험 중립 SDPG와 유사한 훈련 성능를 유지하면서도 테스트 시 강건성은 크게 향상시켰으며, 효과적인 위험 인지 정책 학습이 가능함을 입증했다.
  • 결과적으로 CVaR 기반 최적화가 모델 불확실성과 액추에이터 노이즈의 영향을 효과적으로 완화하여, 실제 환경 적용에 더 적합한 정책을 만들어내는 데 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.