Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity-Enriched Option-Critic

Anand Kamat, Doina Precup|arXiv (Cornell University)|2020. 11. 04.
Reinforcement Learning in Robotics참고 문헌 31인용 수 6
한 줄 요약

이 논문은 정보이론적 내재 보상과 새로운 종료 목표를 도입하여 옵션-크리틱 프레임워크를 개선한 엔드 투 엔드 강화학습 방법인 다양성 강화 옵션-크리틱(DEOC)을 제안한다. 이 방법은 옵션 간 행동의 다양성을 증진시켜, 이산 및 연속 제어 과제에서 옵션-크리틱과 PPO를 뛰어넘는 성능을 보이며, 강력하고 해석 가능하며 재사용 가능한 옵션을 생성한다.

ABSTRACT

Temporal abstraction allows reinforcement learning agents to represent knowledge and develop strategies over different temporal scales. The option-critic framework has been demonstrated to learn temporally extended actions, represented as options, end-to-end in a model-free setting. However, feasibility of option-critic remains limited due to two major challenges, multiple options adopting very similar behavior, or a shrinking set of task relevant options. These occurrences not only void the need for temporal abstraction, they also affect performance. In this paper, we tackle these problems by learning a diverse set of options. We introduce an information-theoretic intrinsic reward, which augments the task reward, as well as a novel termination objective, in order to encourage behavioral diversity in the option set. We show empirically that our proposed method is capable of learning options end-to-end on several discrete and continuous control tasks, outperforms option-critic by a wide margin. Furthermore, we show that our approach sustainably generates robust, reusable, reliable and interpretable options, in contrast to option-critic.

연구 동기 및 목표

  • 옵션-크리틱 프레임워크에서 여러 옵션이 동일하거나 중복된 행동을 학습하는 '옵션 붕괴' 문제를 해결하기 위해.
  • 내재적 동기부여를 통해 다양하고 과제 관련된 옵션 정책을 장려함으로써 탐색과 학습 효율성을 향상시키기 위해.
  • 하나의 옵션이 지배하는 것을 방지하고 다양한 옵션의 탐색을 유지하기 위해, 탐색을 지연시키는 종료 목표를 설계하기 위해.
  • 명시적 보상 형태 조정이나 수동으로 설정된 초기화 집합 설계 없이도 재사용 가능하고 해석 가능하며 강력한 옵션을 학습하기 위해.
  • 이해 가능한 옵션을 유지하면서도 이산 및 연속 제어 과제에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 학습된 옵션의 정책 간 다양성을 장려하기 위해 정보이론적 내재 보상을 도입하여, 서로 다른 행동 전략 탐색을 촉진한다.
  • 옵션 가치 비교에 기반한 새로운 종료 목표를 제안하여, 열악한 성능을 보이는 옵션의 종료를 연기함으로써 탐색을 유지하고 조기 지배를 방지한다.
  • 기본 작업 보상에 내재적 다양성 보너스를 추가하여, 작업 성능과 옵션 다양성의 공동 최적화를 수행한다.
  • 모델 자유 설정에서 옵션 정책과 종료 함수를 경량 기반 정책 학습을 통해 엔드 투 엔드로 동시에 학습한다.
  • 다중 옵션 정책 기반 강화 알고리즘 프레임워크를 활용하여, 각 옵션이 작업 수익과 다양성 유도 보상의 조합 목표를 최대화하도록 학습한다.
  • MuJoCo 환경과 표본 태블러 태스크를 포함한 표준 제어 벤치마크에 적용하여, 다양한 도메인으로의 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1옵션-크리틱 프레임워크에서 행동 다양성 기반 내재 보상이 옵션 학습에 개선 효과를 미칠 수 있는가?
  • RQ2학습 중 열악한 성능을 보이는 옵션을 유지하는 새로운 종료 목표가 더 강력하고 다양한 옵션 세트를 생성하는 데 기여하는가?
  • RQ3옵션 정책의 다양성이 복잡한 제어 과제에서 더 나은 샘플 효율성과 최종 성능을 이끌 수 있는가?
  • RQ4학습된 옵션이 이전 학습 시나리오 간 전이 학습 상황에서 얼마나 해석 가능하고 재사용 가능한가?
  • RQ5옵션-크리틱과 PPO에 비해 성능, 강건성, 옵션 품질 측면에서 제안된 방법은 어떠한가?

주요 결과

  • 제안된 방법인 TDEOC는 평가된 모든 연속 제어 과제에서 최신 기술 수준의 성능을 달성하며, 옵션-크리틱과 PPO를 모두 능가한다.
  • TMaze 전이 과제에서 목표가 변경된 후 TDEOC는 최종 성능에서 옵션-크리틱을 뛰어넘어, 더 뛰어난 강건성과 적응 능력을 입증한다.
  • 시각화 결과에 따르면 TDEOC의 옵션 종료 시점은 결정 포인트에 국한되어 있음을 확인할 수 있다—예를 들어 TMaze의 수직 복도나 Hopper-v2의 중공기 상태 등으로, 직관적이고 목표 중심의 행동을 나타낸다.
  • OneRoom 환경에서 한 옵션은 방을 스캔하는 데 전념하고 다른 옵션은 목표지점으로 이동하는 데 전념함으로써, 옵션이 상호 보완적이고 해석 가능한 역할을 수행함을 확인할 수 있다.
  • 수동적 보상 형태 조정이나 명시적 초기화 집합 설계 없이도, 과제 간 일관된 다양성, 신뢰성, 재사용 가능성을 갖춘 옵션을 생성한다.
  • 실험 결과에 따르면 내재적 다양성 보상과 새로운 종료 목표가 함께 작용하여 탐색을 향상시키고 옵션 붕괴를 방지함을 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.