Skip to main content
QUICK REVIEW

[논문 리뷰] SOAC: The Soft Option Actor-Critic Architecture

Chenghao Li, Xiaoteng Ma|arXiv (Cornell University)|2020. 06. 25.
Optimization and Search Problems참고 문헌 43인용 수 7
한 줄 요약

SOAC는 최대 엔트로피 강화학습과 정보이론적 내재 보상과 옵션 프레임워크를 통합하여 효과적인 탐색과 안정적인 훈련을 가능하게 하는 안정적이고 비정책 기반의 딥 강화학습 알고리즘을 제안한다. 이 알고리즘은 Mujoco 벤치마크에서 이전의 정책 기반 및 비정책 기반 방법들을 능가하며, 강력한 상태-행동 공간 일관성과 이식 가능한 고수준 정책을 갖춘 다양한, 일관된 옵션을 학습한다.

ABSTRACT

The option framework has shown great promise by automatically extracting temporally-extended sub-tasks from a long-horizon task. Methods have been proposed for concurrently learning low-level intra-option policies and high-level option selection policy. However, existing methods typically suffer from two major challenges: ineffective exploration and unstable updates. In this paper, we present a novel and stable off-policy approach that builds on the maximum entropy model to address these challenges. Our approach introduces an information-theoretical intrinsic reward for encouraging the identification of diverse and effective options. Meanwhile, we utilize a probability inference model to simplify the optimization problem as fitting optimal trajectories. Experimental results demonstrate that our approach significantly outperforms prior on-policy and off-policy methods in a range of Mujoco benchmark tasks while still providing benefits for transfer learning. In these tasks, our approach learns a diverse set of options, each of whose state-action space has strong coherence.

연구 동기 및 목표

  • 옵션 프레임워크를 사용한 계층적 강화학습에서 비효율적인 탐색과 불안정한 정책 업데이트 문제를 해결하기 위해.
  • 고수준 옵션 선택과 저수준 내옵션 정책의 안정적이고 비정책 기반의 훈련을 가능하게 하기 위해.
  • 정보이론적 내재 보상으로 샘플 효율성과 정책 다양성을 향상시키기 위해.
  • 이식 가능한 일반 목적의 옵션 선택 정책을 학습하여 전이 학습을 촉진하기 위해.
  • 부드러운 최적성과 확률 추론을 통한 정책 최적화와 최적 궤적 피팅을 이론적으로 연결하기 위해.

제안 방법

  • 옵션 선택과 내옵션 정책의 탐색과 강건성을 향상시키기 위해 최대 엔트로피 설정을 도입한다.
  • 다양한 내옵션 정책의 식별성을 향상시키기 위해 정보이론적 내재 보상을 활용한다.
  • 최적성 표현과 최적 궤적 피팅 문제의 단순화를 위해 확률 추론 모델을 사용한다.
  • 행동 정책와 타겟 정책를 분리하기 위해 소프트 Q-학습을 사용한 비정책 학습을 적용하여 업데이트의 불안정성을 감소시킨다.
  • 부드러운 최적성을 사용하여 정책 평가와 정책 개선을 번갈아 수행함으로써 유연한 행동 정책 업데이트를 가능하게 한다.
  • 옵션 선택과 최적성에 대한 은닉 변수를 포함한 그래픽 모델을 활용하여 계층적 의사결정을 모델링한다.

실험 결과

연구 질문

  • RQ1동시에 옵션과 내옵션 정책을 학습하는 계층적 강화학습에서 비정책 기반 최대 엔트로피 접근법이 훈련을 안정화시킬 수 있는가?
  • RQ2정보이론에 기반한 내재 보상은 학습된 옵션의 다양성과 식별성에 어떻게 기여하는가?
  • RQ3옵션 선택 정책이 다양한 작업 간에 일관되고 명확한 상태-행동 부분공간을 학습하는 정도는 어느 정도인가?
  • RQ4사전에 학습된 옵션 선택 정책이 새로운, 상이한 환경에서 학습을 가속화하는 데 효과적으로 전이될 수 있는가?
  • RQ5제안된 부드러운 최적성 프레임워크 하에서 최적화 문제는 최적 궤적 피팅과 동치인가?

주요 결과

  • SOAC는 다양한 Mujoco 벤치마크 작업에서 이전의 정책 기반 및 비정책 기반 방법들을 크게 능가하며, 뛰어난 샘플 효율성과 안정적인 학습 곡선을 달성한다.
  • t-SNE 시각화 결과 각 옵션과 관련된 상태-행동 공간의 강한 일관성이 확인되어 명확하고 잘 학습된 부분 정책을 나타낸다.
  • 옵션 선택 정책은 환경의 다양한 상태에 대해 서로 다른 옵션을 할당함으로써 고도의 작업 분해 능력을 보여준다.
  • 사전에 학습된 옵션 선택 정책을 전이하면, 예를 들어 후진 점프를 위한 Hopper-v2와 같이 보상 함수가 반전된 새로운 환경에서 학습이 빠르게 가속화된다.
  • 부드러운 최적성과 비정책 학습 프레임워크 덕분에 정책 업데이트의 불안정성이 감소하여 안정적인 훈련을 달성한다.
  • 내재 보상 메커니즘이 다양한 효과적인 옵션의 탐색을 성공적으로 유도하여 단일 옵션 지배 문제를 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.