Skip to main content
QUICK REVIEW

[논문 리뷰] Risk-Sensitive Generative Adversarial Imitation Learning

Jonathan Lacotte, Mohammad Ghavamzadeh|arXiv (Cornell University)|2018. 08. 13.
Human Pose and Action Recognition인용 수 10
한 줄 요약

이 논문은 GAIL을 확장하여 전문가 정책의 기대 성능 뿐만 아니라 위험 프로파일—특히 CVaR와 VaR—을 일치시키는 새로운 프레임워크인 Risk-Sensitive Generative Adversarial Imitation Learning(RS-GAIL)을 제안한다. 위험 통합 점유도 측도 위에서 JS 발산과 워샤프스키 거리에 기반한 위험 민감성 임itation 학습을 정식화함으로써, RS-GAIL는 MuJoCo 및 OpenAI 제어 환경에서 GAIL과 RAIL에 비해 더 뛰어난 위험 인식 성능을 달성한다. 특히 尾부 위험 지표에서 두드러진 성능을 보인다.

ABSTRACT

We study risk-sensitive imitation learning where the agent's goal is to perform at least as well as the expert in terms of a risk profile. We first formulate our risk-sensitive imitation learning setting. We consider the generative adversarial approach to imitation learning (GAIL) and derive an optimization problem for our formulation, which we call it risk-sensitive GAIL (RS-GAIL). We then derive two different versions of our RS-GAIL optimization problem that aim at matching the risk profiles of the agent and the expert w.r.t. Jensen-Shannon (JS) divergence and Wasserstein distance, and develop risk-sensitive generative adversarial imitation learning algorithms based on these optimization problems. We evaluate the performance of our algorithms and compare them with GAIL and the risk-averse imitation learning (RAIL) algorithms in two MuJoCo and two OpenAI classical control tasks.

연구 동기 및 목표

  • 위험 중립성 임itation 학습의 한계를 해결하여 전문가의 위험 프로파일(CVaR 및 VaR 포함)을 유지하는 데 목적이 있다.
  • 에이전트가 기대 수익 외에도 전문가의 위험 프로파일을 일치시켜야 하는 위험 민감성 임itation 학습 설정을 정식화하는 데 목적이 있다.
  • 위험 통합 발산을 기반으로 한 점유도 측도를 일치시킴으로써 위험 민감성 목표를 최적화하는 GAIL 기반 프레임워크를 개발하는 데 목적이 있다.
  • 정량적 위험 지표를 사용하여 벤치마크 제어 작업에서 제안된 RS-GAIL 알고리즘을 GAIL 및 RAIL과 비교 평가하는 데 목적이 있다.

제안 방법

  • 위험 민감성 임itation 학습을 전문가와 에이전트의 위험 프로파일을 제논-샤논 발산과 워샤프스키 거리로 일치시키는 최적화 문제로 정식화한다.
  • 볼록 쌍대성에 의해 위험 민감성 정규화를 GAIL 목표에 통합함으로써 두 가지 변종인 JS-RS-GAIL 및 W-RS-GAIL를 유도한다.
  • 표준 상태-행동 분포가 아닌 위험 프로파일을 캐릭터라이즈하는 점유도 측도를 사용함으로써 위험 인식 정책 학습을 가능하게 한다.
  • 위험 통합 측도 하에서 에이전트와 전문가의 트레이젝터리를 구분하는 디스크림이너를 사용한 적대적 훈련을 구현한다.
  • 정책 그라디언트 방법을 사용한 딥 강화 학습을 통해 연속 제어 환경에 적용한다.
  • 이중 단계 훈련 프로세스를 적용한다: 디스크림이너는 위험 통합 트레이젝터리를 구분하도록 훈련되고, 생성자(정책)는 위험 인식 발산을 최소화하도록 업데이트된다.

실험 결과

연구 질문

  • RQ1GAIL 기반 프레임워크는 전문가 정책의 기대 성능뿐 아니라 위험 프로파일(CVaR 등)까지 일치시킬 수 있는가?
  • RQ2위험 통합 점유도 측도에 적용했을 때, JS 발산과 워샤프스키 거리는 임itation 학습에서 어떻게 성능을 발휘하는가?
  • RQ3제안된 RS-GAIL 방법은 연속 제어 작업에서 VaR 및 CVaR와 같은 위험 민감성 지표에서 GAIL 및 RAIL을 능가하는가?
  • RQ4네트워크 용량은 워샤프스키 기반 RS-GAIL의 성능에 어떻게 영향을 미치며, JS 기반 변종과 비교해보면 어떠한가?
  • RQ5위험 회피 행동이 핵심적인 복잡한 환경으로도 제안된 방법이 일반화 가능한가?

주요 결과

  • 허퍼 테스크에서 JS-RS-GAIL는 평균 수익 -5622 ± 198을 기록하여 동일한 위험 프로파일 하에서 GAIL(-5428 ± 191) 및 RAIL(-6894 ± 241)을 앞서나갔다.
  • 워커2d 환경에서 JS-RS-GAIL는 λ=0.05일 때 CVaRα를 -5202 ± 222로 기록하여 RAIL(-6111 ± 202) 및 GAIL(-4913 ± 231)보다 뚜렷이 뛰어났다.
  • 카트폴 환경에서 W-RS-GAIL는 위험 민감성 지표에서 ραλ을 -384 ± 10으로 기록하여 W-GAIL(평균 -314 ± 9) 및 RAIL(-7714 ± 72)를 앞섰다.
  • 작은 네트워크 설정에서는 JS 기반 RS-GAIL 변종이 워샤프스키 기반 변종보다 일관되게 뛰어난 성능을 보였으며, 이는 가중치 클리핑이 적용된 네트워크의 표현 능력이 제한되었기 때문일 것이다.
  • 실험 결과에 따르면, 표준 GAIL은 평균 성능이 일치하더라도 CVaR 및 VaR 간 큰 격차가 있음으로써 전문가의 위험 프로파일을 유지하지 못함을 보여준다.
  • 저자들은 워샤프스키 기반 RS-GAIL가 더 복잡한 환경과 고용량 네트워크에서 더 나은 성능을 보일 수 있을 것으로 추측하며, 이러한 환경에서의 추가 평가가 필요하다고 제안한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.