[논문 리뷰] Diversity Actor-Critic: Sample-Aware Entropy Regularization for Sample-Efficient Exploration
이 논문은 표본 효율적인 강화학습 알고리즘인 다각도 액터-크리틱(Diversity Actor-Critic, DAC)을 제안한다. 이 알고리즘은 표본 인지 기반 엔트로피 정규화를 통해 탐색을 향상시킨다. 현재 정책의 행동 분포와 재생 버퍼의 행동 분포의 가중 조합의 엔트로피를 최대화하기 위해 젠슨-쇼넌 다이버전스를 사용함으로써, 고차원 및 희박 보상 환경에서 탐색 성능을 향상시킨다. 이로 인해 DAC는 여러 MuJoCo 벤치마크에서 최신 기술인 SAC 및 TD3를 능가한다.
In this paper, sample-aware policy entropy regularization is proposed to enhance the conventional policy entropy regularization for better exploration. Exploiting the sample distribution obtainable from the replay buffer, the proposed sample-aware entropy regularization maximizes the entropy of the weighted sum of the policy action distribution and the sample action distribution from the replay buffer for sample-efficient exploration. A practical algorithm named diversity actor-critic (DAC) is developed by applying policy iteration to the objective function with the proposed sample-aware entropy regularization. Numerical results show that DAC significantly outperforms existing recent algorithms for reinforcement learning.
연구 동기 및 목표
- 재생 버퍼 정보를 정책 탐색에 통합함으로써 오프-폴리시 강화학습의 표본 효율성을 향상시키는 것.
- 기존 정책 엔트로피 정규화의 한계를 해결하기 위해, 재생 버퍼 내 역사를 반영하지 않는 문제를 해결하는 것.
- 재생 버퍼의 행동 분포를 명시적으로 계산하지 않고도 탐색을 향상시키는 실용적인 알고리즘을 개발하는 것.
- 희박 보상 또는 고차원 행동 차원을 가진 도전적인 연속 제어 과제에서 뛰어난 성능을 달성하는 것.
- 정책 엔트로피와 재생 기반 행동 분포 다양성의 동시 최적화가 더 효과적인 탐색을 이끌 수 있음을 보여주는 것.
제안 방법
- 현재 정책 행동 분포와 재생 버퍼의 행동 분포의 가중 합의 엔트로피를 최대화하는 표본 인지 기반 엔트로피 정규화를 제안한다.
- 정책과 재생 버퍼 행동 분포 간의 다이버전스를 측정하기 위해 젠슨-쇼넌 다이버전스(D_JS^α)를 서rogate로 사용하여 효율적인 최적화를 가능하게 한다.
- 학습 중에 정책 엔트로피와 재생 분포 일치를 동적으로 균형 잡는 적응형 온도 파rameter α를 도입한다.
- 제안된 목적 함수에 정책 반복을 적용하여 실용적인 오프-폴리시 알고리즘인 DAC를 개발하며, 재생 분포를 명시적으로 계산하지 않는다.
- 과거 트레이젝터리를 저장하기 위해 재생 버퍼를 사용하고, 버퍼 내 행동의 경험 분포를 역사적 탐색 패턴의 대체 측정 기준으로 사용한다.
- 소프트 액터-크리틱 프레임워크를 수정하여 표본 인지 정규화를 액터-크리틱 업데이트 과정에 통합한다.
실험 결과
연구 질문
- RQ1재생 버퍼에서의 이력 표본 분포를 통합함으로써 오프-폴리시 강화학습에서 탐색 성능을 향상시킬 수 있는가?
- RQ2표본 인지 엔트로피 정규화는 표준 정책 엔트로피 정규화보다 더 높은 표본 효율성과 최종 성능을 달성하는가?
- RQ3정책 엔트로피와 재생 기반 행동 다양성의 동시 최적화가 고차원 제어 과제에서 학습 안정성과 수렴에 어떤 영향을 미치는가?
- RQ4DAC은 희박 보상 환경에서 기존 오프-폴리시 알고리즘인 SAC 및 TD3보다 어느 정도 뛰어나게 성능을 발휘하는가?
- RQ5적응형 온도 파rameter α는 DAC에서 탐색과 이용 간의 균형에 어떤 영향을 미치는가?
주요 결과
- DAC는 평가된 모든 MuJoCo 환경에서 SAC 및 최근의 다른 알고리즘을 크게 능가한다. 이는 희박 보상 및 고차원 행동 차원을 가진 환경에서도 해당된다.
- HumanoidStandup-v1 환경에서 DAC는 최대 평균 수익 197,302.37 ± 43,055.31을 기록했으며, 이는 SAC(58,693.87 ± 12,269.93)와 PPO(160,211.90 ± 3,268.37)를 모두 초월한다.
- DelayedHalfCheetah-v1 작업에서 DAC는 7,594.70 ± 1,259.23을 기록했고, 이는 SAC(4,639.85 ± 1,393.95)와 PPO(2,247.92 ± 640.69)를 모두 능가한다.
- 절단 실험 결과, DAC의 성능은 엔트로피 계수 β와 제어 계수 c의 다양한 값에 대해 뛰어난 내재성을 보이며, c = -2.0·dim(A)에서 최적의 성능을 기록한다.
- Jensen-Shannon 다이버전스를 사용한 DAC는 단지 KL 다이버전스 또는 JS 다이버전스만 사용하는 SAC 변종보다 뚜렷한 성능 우위를 보이며, 이는 공동 정규화 접근의 효과성을 입증한다.
- DAC는 DelayedHopper-v1, DelayedWalker2d-v1, DelayedAnt-v1를 포함한 모든 테스트 환경에서 뛰어난 성능을 유지하며, 표본 효율성과 최종 수익에서 일관된 성과 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.