Skip to main content
QUICK REVIEW

[논문 리뷰] Distributional Soft Actor Critic for Risk Sensitive Learning.

Xiaoteng Ma, Qiyuan Zhang|arXiv (Cornell University)|2020. 04. 30.
Reinforcement Learning in Robotics참고 문헌 47인용 수 12
한 줄 요약

이 논문은 분포 기반 소프트 액터-크리틱(DSAC)을 제안하며, 분포 기반 강화학습과 최대 엔트로피 강화학습을 통합하여 수익의 전체 분포를 모델링하고 정책 다양성을 향상시킨다. 완전히 파arameterized된 분위수 함수를 활용함으로써 DSAC은 위험 감수성 제어를 가능하게 하며, 다양한 위험 선호도에 적응 가능한 안정성과 성능을 바탕으로 최신 기법들을 초월한다.

ABSTRACT

Most of reinforcement learning (RL) algorithms aim at maximizing the expectation of accumulated discounted returns. Since the accumulated discounted return is a random variable, its distribution includes more information than its expectation. Meanwhile, entropy of policy indicates its diversity and it can help improve the exploration capability of algorithms. In this paper, we present a new RL algorithm named Distributional Soft Actor Critic (DSAC), combining distributional RL and maximum entropy RL together. Taking the randomness both in action and discounted return into consideration, DSAC over performs the state-of-the-art baselines with more stability in several continuous control benchmarks. Moreover, distributional information of returns can also be used to measure metrics other than expectation, such as risk-related metrics. With a fully parameterized quantile function, DSAC is easily adopted to optimize policy under different risk preferences. Our experiments demonstrate that with distribution modeling in RL the agent performs better both for risk-averse and risk-seeking control tasks.

연구 동기 및 목표

  • 표준 강화학습 알고리즘의 한계를 해결하기 위해 평균 수익만 최적화하는 방식에서 벗어나 수익의 전체 분포를 고려한다.
  • 학습 목표에 엔트로피 정규화를 통합하여 탐색 능력과 정책 다양성을 향상시킨다.
  • 수익의 분포를 모델링하여 위험 감수성 학습을 가능하게 하며, 다양한 위험 선호도(예: 위험 회피 또는 위험 추구)에 따라 최적화할 수 있도록 한다.
  • 분포 기반 수익과 엔트로피 최대화를 통합한 통합 프레임워크를 개발하여 연속 제어에서 더 높은 샘플 효율성과 강건성을 확보한다.
  • 다양한 위험 프로파일에서 안정적이고 적응 가능한 정책 학습이 가능한 분포 기반 모델링의 효과를 입증한다.

제안 방법

  • 누적 할인 수익의 전체 분포를 파arameterized된 분위수 함수를 사용하여 모델링하는 분포 기반 강화학습 프레임워크를 도입한다.
  • 분포 기반 수익 모델링과 최대 엔트로피 강화학습을 결합하여 정책 엔트로피를 통해 탐색을 장려한다.
  • 크리틱이 분위수 출력을 통해 수익의 분포를 추정하는 소프트 액터-크리틱 아키텍처를 사용하여 위험 인식 가치 추정을 가능하게 한다.
  • 다양한 위험 지표(예: 조건부가치위험(CVaR))에 대한 탄력적인 최적화를 가능하게 하기 위해 완전히 파arameterized된 분위수 함수를 활용한다.
  • 분위수 회귀 손실을 최소화하는 분포 기반 벨먼 업데이트를 사용하여 정책 및 가치 네트워크를 엔드 투 엔드로 훈련시킨다.
  • 훈련 중 분위수 수준을 조정하여 위험 감수성 행동을 지원하며, 위험 회피 또는 위험 추구 목표에 맞는 정책 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1분포 기반 강화학습과 최대 엔트로피 강화학습을 조합하면 연속 제어 과제에서 더 안정적이고 샘플 효율적인 학습이 가능할까?
  • RQ2수익의 전체 분포를 모델링하면 평균 값에만 의존하는 방법과 비교해 정책 성능이 어떻게 향상되는가?
  • RQ3분포 기반 수익 모델이 다양한 위험 선호도 하에서 위험 감수성 제어를 얼마나 잘 지원할 수 있는가?
  • RQ4제안된 방법은 다양한 벤치마크에서 평균 수익과 강건성 측면에서 최신 기법들을 초월할 수 있는가?
  • RQ5정책 엔트로피의 포함이 고차원 제어 환경에서 탐색 능력과 수렴 속도에 어떤 영향을 미치는가?

주요 결과

  • DSAC는 다양한 연속 제어 벤치마크에서 최신 기준 기반 알고리즘들을 능가하는 뛰어난 성능을 기록하며, 안정성과 샘플 효율성 향상을 입증한다.
  • 분포 기반 수익 모델링의 통합을 통해 조건부가치위험(CVaR)과 같은 위험 관련 지표에 효과적으로 최적화할 수 있으며, 위험 회피 및 위험 추구 행동을 지원한다.
  • 수익의 전체 분포를 모델링함으로써 엔트로피 정규화를 통해 정책 다양성을 향상시켜 더 나은 탐색 능력과 빠른 수렴을 이룬다.
  • 높은 수익과 낮은 분산 성능 모두에서 일관된 향상을 보이며, 다양한 위험 선호도에 대한 강건성을 입증한다.
  • 완전히 파arameterized된 분위수 함수의 사용으로 아키텍처 변경 없이도 다양한 위험 목표에 유연하게 적응할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.