Skip to main content
QUICK REVIEW

[논문 리뷰] A Max-Min Entropy Framework for Reinforcement Learning

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|2021. 06. 19.
Reinforcement Learning in Robotics참고 문헌 55인용 수 5
한 줄 요약

이 논문은 강화학습을 위한 최대-최소 엔트로피(MME) 프레임워크를 제안하며, 표준 최대 엔트로피 RL이 고엔트로피 상태를 선호하는 것과는 대조적으로, 저엔트로피 상태를 대상으로 하여 그 엔트로피를 극대화함으로써 탐색을 향상시킨다. 이 방법은 탐색과 이용을 분리하는 분리형 액터-크리틱 알고리즘을 통해 실현되며, 희소 보상 및 고차원 제어 작업에서 SAC 및 기타 최신 기법들보다 뚜렷한 성능 향상을 이룬다.

ABSTRACT

In this paper, we propose a max-min entropy framework for reinforcement learning (RL) to overcome the limitation of the soft actor-critic (SAC) algorithm implementing the maximum entropy RL in model-free sample-based learning. Whereas the maximum entropy RL guides learning for policies to reach states with high entropy in the future, the proposed max-min entropy framework aims to learn to visit states with low entropy and maximize the entropy of these low-entropy states to promote better exploration. For general Markov decision processes (MDPs), an efficient algorithm is constructed under the proposed max-min entropy framework based on disentanglement of exploration and exploitation. Numerical results show that the proposed algorithm yields drastic performance improvement over the current state-of-the-art RL algorithms.

연구 동기 및 목표

  • 함수 근사가 수반되는 이완적 강화학습에서 최대 엔트로피 RL의 한계를 해결하기 위해, 긍정 피드백 루프가 효과적인 탐색을 방해하는 문제를 다루기.
  • 표준 최대 엔트로피 RL이 고엔트로피 상태를 선호하는 경향이 있어 탐색 다양성이 감소할 수 있음을 해결하기.
  • 저엔트로피 상태에서 엔트로피를 극대화함으로써 공정한 탐색을 촉진하고 상태공간 커버리지 향상을 위한 프레임워크 개발.
  • 복잡한 환경에서 성능 향상을 위해 탐색과 이용을 분리하는 최대-최소 엔트로피 프레임워크 기반 실용적 액터-크리틱 알고리즘 설계.
  • 특히 탐색이 핵심적인 희소 보상 설정에서 도전적인 연속 제어 작업에서 최신 기법들에 비해 뛰어난 성능을 입증하기.

제안 방법

  • 최고 엔트로피 상태를 선호하는 것과는 달리, 상태공간 내에서 가장 낮은 엔트로피를 가진 상태의 엔트로피를 극대화하는 최대-최소 엔트로피 목적함수 제안.
  • 정책이 상태 간 최소 엔트로피를 극대화하도록 하는, 상태 엔트로피에 대한 최소-최대 최적화 문제로 MME 목적함수를 수식화.
  • 탐색을 위한 Q함수 업데이트(저엔트로피 상태를 대상으로 함)와 정책 업데이트(정책 엔트로피 극대화 유지)를 분리하는 분리형 액터-크리틱 알고리즘을 통해 프레임워크 구현.
  • 낮은 엔트로피를 가진 상태를 방문하도록 유도하는 수정된 Q-학습 업데이트를 사용하며, 同시에 수익 극대화를 위한 표준 소프트 Q-학습 업데이트 유지.
  • Q함수를 방문된 상태의 엔트로피를 최소화하도록 최적화하고, 정책는 자신의 엔트로피를 극대화하도록 최적화하는 이중 최적화 체계 도입.
  • 순수 탐색 및 보상 환경에 모두 프레임워크 적용; 밀도 높은 보상 작업에서 탐색과 수익 목표를 분리하는 분리형 버전(DE-MME) 도입.

실험 결과

연구 질문

  • RQ1이완적 딥 강화학습에서 함수 근사를 사용할 때 최대-최소 엔트로피 프레임워크가 탐색을 향상시킬 수 있는가?
  • RQ2저엔트로피 상태를 대상으로 하는 것이 최대 엔트로피 RL에 비해 더 나은 상태공간 커버리지와 긍정 피드백 루프 감소를 이끌 수 있는가?
  • RQ3MME 프레임워크에서 탐색과 이용을 분리하면 밀도 높은 보상 환경에서 더 나은 성능을 낼 수 있는가?
  • RQ4희소 보상 제어 작업에서 제안된 MME 알고리즘이 SAC, DAC, RND와 같은 최신 기법들에 비해 어떻게 비교되는가?
  • RQ5MME의 성능 향상 요인이 탐색 향상 외의 다른 요인들 때문일 가능성은 어느 정도인가?

주요 결과

  • DelayedHalfCheetah 환경에서 MME 알고리즘은 평균 수익 최대 3435.28 ± 39.55를 기록하여, SAC(817.40 ± 253.54) 및 기타 기준선들보다 뚜렷이 뛰어난 성능을 보였다.
  • SparseWalker2d 작업에서 MME는 886.60 ± 25.77의 성과를 기록하며, SAC(817.40 ± 253.54)와 RND(705.30 ± 274.88)를 모두 능가하여 희소 보상 환경에서의 강력한 성능을 입증했다.
  • 분리형 버전(DE-MME)은 SparseAnt에서 973.60 ± 12.55의 수익을 기록하여 MME(953.70 ± 28.39) 및 모든 다른 방법들을 능가했으며, 탐색과 이용을 분리하는 것이 유의미한 이점을 제공함을 시사했다.
  • 고차원 밀도 높은 보상 작업인 HumanoidStandup에서 DE-MME는 250,935.53 ± 49,386.43의 성과를 기록하여, SAC(167,394.36 ± 7,291.99) 및 PPO(160,211.90 ± 3,268.37)를 모두 초월했다.
  • 제거 실험 결과, MME의 성능 향상 요인이 의도한 대로 최대-최소 엔트로피 설계에 기인한 개선된 탐색 때문임을 확인했다.
  • 고엔트로피 상태에 대한 집중을 피하고, 이완적 학습에서 긍정 피드백 루프를 감소시킴으로써 더 넓고 공정한 상태공간 탐색이 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.