Skip to main content
QUICK REVIEW

[논문 리뷰] HyAR: Addressing Discrete-Continuous Action Reinforcement Learning via Hybrid Action Representation

Boyan Li, Hongyao Tang|arXiv (Cornell University)|2021. 09. 12.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 조건부 VAE와 액션 임베딩 테이블을 사용하여 이산-연속 액션 공간의 압축되고 분리된 잠재 공간을 학습하는 하이브리드 액션 표현 프레임워크인 HyAR을 제안한다. 이는 이산 및 연속 구성 요소 간의 종속성을 모델링하고, 비지도 동역학 예측을 통해 표현을 훈련시켜, 복잡하고 고차원적인 하이브리드 액션 환경에서 효과적인 딥 강화학습을 가능하게 하며, 샘플 효율성과 최종 성능 모두에서 이전 방법들을 능가한다.

ABSTRACT

Discrete-continuous hybrid action space is a natural setting in many practical problems, such as robot control and game AI. However, most previous Reinforcement Learning (RL) works only demonstrate the success in controlling with either discrete or continuous action space, while seldom take into account the hybrid action space. One naive way to address hybrid action RL is to convert the hybrid action space into a unified homogeneous action space by discretization or continualization, so that conventional RL algorithms can be applied. However, this ignores the underlying structure of hybrid action space and also induces the scalability issue and additional approximation difficulties, thus leading to degenerated results. In this paper, we propose Hybrid Action Representation (HyAR) to learn a compact and decodable latent representation space for the original hybrid action space. HyAR constructs the latent space and embeds the dependence between discrete action and continuous parameter via an embedding table and conditional Variantional Auto-Encoder (VAE). To further improve the effectiveness, the action representation is trained to be semantically smooth through unsupervised environmental dynamics prediction. Finally, the agent then learns its policy with conventional DRL algorithms in the learned representation space and interacts with the environment by decoding the hybrid action embeddings to the original action space. We evaluate HyAR in a variety of environments with discrete-continuous action space. The results demonstrate the superiority of HyAR when compared with previous baselines, especially for high-dimensional action spaces.

연구 동기 및 목표

  • 기존 강화학습 방법이 이산-연속 하이브리드 액션 공간을 다룰 때 구조적 종속성을 忽시하거나 확장성 문제를 겪는 데 기인한 한계를 해결하기 위해.
  • 이산 액션과 그 연속적 파라미터 간의 종속성을 유지하는 통합적이고 압축적이며 의미적으로 부드러운 잠재 표현 공간을 개발하기 위해.
  • 표현 학습 중 비지도 동역학 예측을 활용하여 고차원 하이브리드 액션 공간에서 샘플 효율성과 정책 일반화 능력을 향상시키기 위해.
  • 기존의 DRL 알고리즘들이 학습된 잠재 공간에서 효과적으로 작동할 수 있도록 하되, 환경 상호작용을 위해 원래의 액션 공간으로 복원하는 것을 가능하게 하기 위해.

제안 방법

  • HyAR는 이산 액션을 위한 임베딩 테이블과 이산 액션과 그 연속적 파라미터 간의 종속성을 모델링하기 위한 조건부 변분 오토에인드라이저(Conditional VAE)를 사용하여 하이브리드 액션 표현을 구성한다.
  • 환경의 동역학을 비지도로 예측함으로써 잠재 공간이 의미적으로 부드러워지도록 훈련되어 정책 일반화 능력이 향상된다.
  • 이중 단계 훈련 과정을 적용한다: 첫 번째로, 웜업 단계에서 시범 데이터를 수집하여 표현을 사전 훈련하고, 두 번째로, TD3와 같은 표준 DRL 알고리즘을 사용하여 잠재 공간에서 정책을 훈련한다.
  • 에이전트는 환경 상호작용을 위해 학습된 잠재 임베딩을 원래의 하이브리드 액션 공간으로 복원한다.
  • 모든 하이브리드 액션 공간(구조적 또는 비구조적)을 Parameterized Action MDP(PAMDP) 프레임워크에 따라 통일적으로 기술함으로써 이 방법은 다양한 환경에 적용 가능하다.

실험 결과

연구 질문

  • RQ1압축되고 분리된 잠재 표현이 하이브리드 액션 공간에서 이산 액션과 그 연속적 파라미터 간의 종속성을 효과적으로 모델링할 수 있는가?
  • RQ2비지도 동역학 예측을 통한 의미적으로 부드러운 표현 학습이 하이브리드 액션 강화학습에서 샘플 효율성과 정책 성능을 향상시키는가?
  • RQ3고차원 하이브리드 액션 작업에서 PADDPG, HPPO, PDQN과 같은 기존 방법들과 비교해 HyAR는 확장성과 성능 면에서 어떻게 다른가?
  • RQ4대부분의 표현 학습 주기 설정이 HyAR의 정책 학습에 미치는 영향은 어느 정도인가?

주요 결과

  • HyAR는 평가된 모든 환경에서 PADDPG, HPPO, PDQN과 같은 베이스라인 방법들을 능가하며, 특히 고차원 액션 공간에서 두각을 나타낸다.
  • 정책 훈련 중에도 표현을 계속 업데이트하는 '고정되지 않은(HyAR)' 버전은 복잡한 환경(예: Goal 및 Hard Goal)에서 성능이 열악한 고정 표현 베이스라인보다 항상 뛰어나다.
  • 표현 업데이트를 매 10에피소드마다 수행하는 중간 수준의 빈도가 가장 뛰어난 성능을 보였으며, 표현의 안정성과 적응성 사이의 균형을 잘 이룩하였다.
  • 8개의 이산 액션을 가진 Hard Move 환경에서는 고정 표현 베이스라인보다 HyAR가 훨씬 높은 최종 보상과 더 빠른 수렴 속도를 달성했다.
  • 제거 실험 결과, 이산 및 연속 구성 요소 간의 종속성 모델링이 성능 향상에 핵심적임을 확인하였으며, 이러한 구조를 忽시한 방법들은 성능이 열 劣하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.