Skip to main content
QUICK REVIEW

[논문 리뷰] Actor-Expert: A Framework for using Q-learning in Continuous Action Spaces

Sungsu Lim|arXiv (Cornell University)|2019. 01. 01.
Model Reduction and Neural Networks참고 문헌 54인용 수 13
한 줄 요약

이 논문은 액터-전문가(Actor-Expert)를 소개한다. 이는 액션-밸류 업데이트를 전문가(Expert)가 근사 Q-학습을 통해 수행하고, 액터(Actor)가 조건부 교차 엔트로피 방법(CCEM)을 사용하여 최적의 액션을 반복적으로 학습함으로써 Q-학습과 정책 최적화를 분리하는 프레임워크이다. 이 방법은 제약 없는 함수 근사와 함께 연속된 액션 공간에서 정확하고 효율적인 Q-학습을 가능하게 하며, 이전의 Q-학습 방법을 능가하고 액터-크리틱 기반 방법과도 경쟁 가능하다.

ABSTRACT

Q-learning can be difficult to use in continuous action spaces, because a difficult optimization has to be solved to find the maximal action. Some common strategies have been to discretize the action space, solve the maximization with a powerful optimizer at each step, restrict the functional form of the action-values, or optimize a different entropy-regularized objective to learn a policy proportional to action-values. Such methods however, can prevent learning accurate action-values, be expensive to execute at each step, or find a potentially suboptimal policy. In this thesis, we propose a new policy search objective that facilitates using Q-learning and a new framework called Actor-Expert, that optimizes this objective. The Expert uses approximate Q-learning to update the action-values towards optimal action-values. The Actor iteratively learns the maximal actions over time for these changing action-values. We develop a Conditional Cross Entropy Method (CCEM) for the Actor, where such a global optimization approach facilitates use of generically parameterized action-values (Expert) with a separate policy (Actor). This method iteratively concentrates density around maximal actions, conditioned on state. We demonstrate in a toy environment that Actor-Expert with unrestricted action-value parameterization and efficient exploration mechanism succeeds while previous Q-learning methods fail. We also demonstrate that Actor-Expert performs as well as or better than previous Q-learning methods on benchmark continuous-action environments. We also show that it is comparable against Actor-Critic baselines, suggesting a new distinction among methods that learn both value function and policy: learning action-values of the current policy or (optimal) action-values decoupled from the policy.

연구 동기 및 목표

  • 액션을 최대화하는 것이 계산적으로 비가능한 연속된 액션 공간에 Q-학습을 적용하는 데 도전하는 것.
  • 액션 공간 이산화, 단계별로 비용이 많이 드는 최적화, 또는 엔트로피 정규화로 인한 부분 최적의 정책과 같은 이전 방법의 한계를 극복하는 것.
  • 액션-밸류의 제약 없는 파rameterization을 지원하면서도 효율적인 정책 학습을 유지하는 프레임워크를 개발하는 것.
  • 정책과 무관하게 최적의 액션-밸류를 정확하게 학습시켜 샘플 효율성과 정책 품질을 향상시키는 것.
  • 값 학습과 정책 학습을 분리함으로써 Q-학습에서의 성능 향상이 이루어지고, 액터-크리틱 방법과도 경쟁 가능하다는 것을 입증하는 것.

제안 방법

  • 전문가 구성요소는 일반적으로 파arameterized된 함수 근사기를 사용하여 근사 Q-학습을 통해 반복적으로 액션-밸류를 최적 값으로 업데이트한다.
  • 액터 구성요소는 현재 상태에서 액션으로 정책을 학습하며, 현재 액션-밸류를 최대화하는 액션 주위에 확률 분포를 집중시는 방식으로 작동한다.
  • 액터는 현재 상태를 조건으로 삼고 반복 과정에서 정책 분포를 개선하는 조건부 교차 엔트로피 방법(CCEM)을 사용한다.
  • CCEM은 기울기 계산이 필요 없이 연속된 액션에 대해 전역 최적화를 가능하게 하여 임의의 액션-밸류 함수 형태와 함께 사용할 수 있다.
  • 이 프레임워크는 정책 학습과 가치 함수 학습을 분리하여 전문가가 액터의 정책과 무관하게 가치를 업데이트할 수 있도록 한다.
  • 이 방법은 기울기 기반 최적화나 고정된 기능 형태에 의존하지 않고 정책 분포의 반복적 개선을 통해 효율적인 탐색을 가능하게 한다.

실험 결과

연구 질문

  • RQ1액션 공간 이산화나 단계별로 비용이 많이 드는 최적화 없이도 연속된 액션 공간에서 Q-학습을 효과적으로 적용할 수 있는가?
  • RQ2값 함수 학습과 정책 학습을 분리함으로써 기존 Q-학습 접근 방식에 비해 샘플 효율성과 정책 성능이 향상되는가?
  • RQ3CCEM을 통해 학습된 정책 네트워크가 기울기 기반 방법에 의존하지 않고 변화하는 액션-밸류에 대해 최적의 액션을 효과적으로 발견할 수 있는가?
  • RQ4Actor-Expert의 성능은 연속 제어 벤치마크에서 확립된 Q-학습 및 액터-크리틱 기반 기준과 비교해 어떻게 되는가?
  • RQ5액션-밸류에 제약 없는 함수 근사를 사용할 경우 연속 제어 작업에서 더 높은 학습 정확도와 정책 품질을 달성할 수 있는가?

주요 결과

  • 이전의 Q-학습 방법이 실패하는 토이 환경에서도 Actor-Expert는 성공적으로 학습을 수행하여 도전적인 설정에서도 강건성을 입증한다.
  • 표준 연속 액션 제어 벤치마크에서 이전의 Q-학습 방법과 비교해 유사하거나 더 뛰어난 성능을 달성한다.
  • Actor-Expert는 액터-크리틱 기반 기준과도 경쟁 가능하며, 값 학습과 정책 학습을 분리함으로써 강력한 성능을 낼 수 있음을 시사한다.
  • CCEM의 사용은 기울기 계산이나 제약 있는 정책 파arameterization이 필요 없이 연속된 액션에 대해 효율적이고 안정적인 최적화를 가능하게 한다.
  • 이 방법은 액션-밸류의 제약 없는 파arameterization을 지원하여 고정된 기능 형태를 사용하는 방법보다 더 정확한 가치 함수 근사를 가능하게 한다.
  • 분리된 아키텍처는 안정적인 훈련과 효과적인 탐색을 가능하게 하며, 기울기 신호에 의존하지 않고도 수익이 높은 액션 주위에 정책이 집중된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.