[논문 리뷰] Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)
이 논문은 Soft Actor-Critic(SAC)의 단일 스토케스틱 가우시안 정책을 이점 가중 혼합 정책(AWMP)으로 대체함으로써, 이는 상태와 이점 함수 표현에 기반해 다수의 정책 구성 요소에 대해 동적으로 가중치를 할당하는 전망 네트워크를 사용하여 비연속적이고 비연속적인 정책을 더 잘 근사할 수 있도록 하는 오프-폴리시 최대 엔트로피 강화학습 알고리즘인 SAC-AWMP를 제안한다. 이 방법은 SAC 및 TD3보다 네 가지 MuJoCo 연속 제어 작업에서 더 뛰어난 샘플 효율성, 안정성 및 성능을 달성하며, 특히 Ant-v2와 같은 과제에서 뚜렷한 개선을 보인다.
The optimal policy of a reinforcement learning problem is often discontinuous and non-smooth. I.e., for two states with similar representations, their optimal policies can be significantly different. In this case, representing the entire policy with a function approximator (FA) with shared parameters for all states maybe not desirable, as the generalization ability of parameters sharing makes representing discontinuous, non-smooth policies difficult. A common way to solve this problem, known as Mixture-of-Experts, is to represent the policy as the weighted sum of multiple components, where different components perform well on different parts of the state space. Following this idea and inspired by a recent work called advantage-weighted information maximization, we propose to learn for each state weights of these components, so that they entail the information of the state itself and also the preferred action learned so far for the state. The action preference is characterized via the advantage function. In this case, the weight of each component would only be large for certain groups of states whose representations are similar and preferred action representations are also similar. Therefore each component is easy to be represented. We call a policy parameterized in this way an Advantage Weighted Mixture Policy (AWMP) and apply this idea to improve soft-actor-critic (SAC), one of the most competitive continuous control algorithm. Experimental results demonstrate that SAC with AWMP clearly outperforms SAC in four commonly used continuous control tasks and achieve stable performance across different random seeds.
연구 동기 및 목표
- 고차원 연속 제어에서 비연속적이고 비연속적인 최적 정책을 표현하는 데 있어 표준 함수 근사기의 한계를 해결하기 위해.
- 전문가의 혼합 방식을 활용하여 오프-폴리시 최대 엔트로피 RL에서 정책 일반화 및 표현 능력을 향상시키기 위해.
- 상태 및 액션 선호도 정보에 기반해 정책 구성 요소의 가중치를 적응적으로 할당하는 방법을 개발하여 정책의 유연성과 학습 안정성을 향상시키기 위해.
- AWMP가 SAC와 원활하게 통합되어 하이퍼파rameter 조정 없이도 베이스라인 SAC 및 TD3를 능가하는 성능을 보임을 입증하기 위해.
제안 방법
- 정책는 다수의 스토케스틱 가우시안 정책 구성 요소의 혼합으로 파arameter화되며, 구성 요소의 가중치는 학습된 전망 네트워크에 의해 결정된다.
- 전망 네트워크는 현재 상태를 입력으로 받아, 이점 가중 정보 최대화를 통해 정책 구성 요소에 대한 확률 분포를 출력한다.
- 가중치는 현재 정책에 의해 유도된 상태-액션 쌍과 샘플된 정책 구성 요소 간의 상호정보량을 최대화함으로써 최적화된다.
- 학습 안정성을 위해 스무딩 계수를 사용하는 타겟 네트워크를 사용하며, 게이팅 정책은 최근 정책의 반경 오프-폴리시 데이터를 사용하여 업데이트된다.
- 이 방법은 오프-폴리시 알고리즘과 호환되며, SAC의 최대 엔트로피 목표와 자동 엔트로피 조정과 자연스럽게 통합된다.
- 정책 구성 요소의 수는 하이퍼파rameter이며, 실험 분석을 통해 모든 과제에서 네 개의 구성 요소에서 최적 성능를 보임을 확인하였다.
실험 결과
연구 질문
- RQ1동적으로 가중치가 할당되는 혼합 정책가 비연속적이고 비연속적인 최적 정책을 연속 제어에서 더 잘 표현할 수 있는가?
- RQ2이점 가중 정보 최대화는 오프-폴리시 RL에서 정책 구성 요소 선택의 일반화 및 안정성에 어떻게 기여하는가?
- RQ3SAC에 AWMP를 적용하면 다양한 MuJoCo 환경에서 SAC 및 TD3보다 더 뛰어난 샘플 효율성과 학습 안정성을 달성하는가?
- RQ4정책 구성 요소의 수를 변화시킬 경우 학습 성능 및 수렴에 어떤 영향을 미치는가?
- RQ5타겟 네트워크의 스무딩 계수 선택이 학습 안정성과 학습 속도에 어떤 영향을 미치는가?
주요 결과
- SAC-AWMP는 네 가지 MuJoCo 연속 제어 과제 전반에서 표준 SAC 및 TD3보다 학습 효율성과 안정성에서 뛰어난 성능을 보이며, 특히 도전적인 Ant-v2 환경에서 가장 두드러진 개선을 보였다.
- Ant-v2에서 SAC-AWMP는 SAC 및 TD3보다 상당히 높은 수익을 달성하여, 복잡한 고차원 제어 과제를 더 효과적으로 해결할 수 있음을 입증하였다.
- 다양한 무작위 시드에서 낮은 분산을 보이는 안정적인 학습 곡선을 보이며, 초기화 및 탐색 노이즈에 대해 강건함을 나타내었다.
- 네 개의 정책 구성 요소를 사용할 경우 최고의 성능를 보였으며, 여덟 개의 구성 요소 역시 낮은 분산을 보여, 능력 증가에 따라 확장성과 안정성이 있음을 시사하였다.
- 하이퍼파rameter 조정 없이도 뛰어난 성능를 유지하여 실용성과 배포 용이성을 높였다.
- 민감도 분석 결과, 작은 스무딩 계수(τQ = 0.001)는 안정성을 보장하지만, 더 큰 값들(τQ = 0.1)은 불안정성과 발산을 유도하는 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.