[논문 리뷰] Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning
이 논문은 연속 제어 작업에서 안정적이고 높은 성능을 발휘할 수 있도록 소프트 정책 그래เดียน트와 더블 샘플링 기반의 소프트 벨만 방정식을 조합한 오프-폴리시, 모델리스 최대 엔트로피 딥 강화학습 알고리즘인 Deep Soft Policy Gradient(DSPG)을 제안한다. Ant, HalfCheetah, Hopper, Walker2d와 같은 벤치마크 환경에서 DDPG와 SAC보다 샘플 효율성, 최종 성능, 학습 안정성 측면에서 뛰어난 성능을 보였다.
Maximum entropy deep reinforcement learning (RL) methods have been demonstrated on a range of challenging continuous tasks. However, existing methods either suffer from severe instability when training on large off-policy data or cannot scale to tasks with very high state and action dimensionality such as 3D humanoid locomotion. Besides, the optimality of desired Boltzmann policy set for non-optimal soft value function is not persuasive enough. In this paper, we first derive soft policy gradient based on entropy regularized expected reward objective for RL with continuous actions. Then, we present an off-policy actor-critic, model-free maximum entropy deep RL algorithm called deep soft policy gradient (DSPG) by combining soft policy gradient with soft Bellman equation. To ensure stable learning while eliminating the need of two separate critics for soft value functions, we leverage double sampling approach to making the soft Bellman equation tractable. The experimental results demonstrate that our method outperforms in performance over off-policy prior methods.
연구 동기 및 목표
- 고차원 연속 제어 작업에서 DDPG와 같은 온-폴리시 방법의 불안정성과 낮은 샘플 효율성 문제를 해결한다.
- 연속 행동 공간에서 복잡한 샘플링 절차가 필요한 오프-폴리시 밸류 기반 방법의 한계를 극복한다.
- 최대 엔트로피 프레임워크 하에서 안정적이고 확장 가능하며 샘플 효율적인 딥 RL 알고리즘을 개발하여 탐색 능력과 강건성을 향상시킨다.
- 두 개의 별도 크리틱이 필요로 하는 소프트 Q-학습의 필요성을 제거하기 위해 단일 크리틱과 더블 샘플링을 사용함으로써 근사 오차를 감소시키고 학습 안정성을 향상시킨다.
- 어려운 연속 제어 벤치마크에서 DDPG와 SAC와 같은 이전 오프-폴리시 방법들보다 뛰어난 성능과 안정성을 달성한다.
제안 방법
- 연속 행동 공간에서 확률적 정책를 최적화하기 위해 엔트로피 정규화된 기대 보상 목적 함수로부터 소프트 정책 그래데이언트를 유도한다.
- 두 개의 딥 네ural 네트워크를 사용하여 오프-폴리시 액터-크리틱 프레임워크를 구성한다: 하나는 확률적 정책(액터)을 위한 것이고, 다른 하나는 소프트 Q-함수(크리틱)를 위한 것이다.
- 소프트 벨만 방정식을 안정적이고 구현 가능한 형태로 만들기 위해 더블 샘플링 접근법을 도입하여 두 개의 별도 크리틱이 필요로 하는 것을 방지한다.
- 정책 개선의 크기를 제약하여 안정적인 정책 업데이트를 보장하기 위해 클리핑된 소프트 정책 그래데이언트를 적용한다.
- 300만 개의 전이를 포함하는 리PLAY 버퍼를 사용하고, 100개의 샘플로 이루어진 미니배치로 학습하며, 환경 단계 4회마다 정책을 업데이트한다.
- 액터와 크리틱에 대해 별도의 학습률을 사용하는 Adam 옵timizer를 사용하고, 안정성을 확보하기 위해 0.01의 업데이트 계수를 사용하는 소프트 타겟 업데이트를 적용한다.
실험 결과
연구 질문
- RQ1최대 엔트로피 프레임워크 하에서 고차원 연속 제어 작업에서 안정적인 오프-폴리시 학습을 가능하게 하는 소프트 정책 그래데이언트 방법을 유도할 수 있는가?
- RQ2소프트 벨만 방정식에 더블 샘플링을 적용할 경우, 이전의 소프트 Q-학습 방법에 비해 안정성 향상과 두 개의 크리틱이 필요로 하는 문제의 제거에 어떤 기여를 하는가?
- RQ3표준 연속 제어 벤치마크에서 DDPG와 SAC에 비해 DSPG는 샘플 효율성과 최종 성능을 어느 정도 향상시키는가?
- RQ4소프트 정책 그래데이언트와 더블 샘플링 기반의 소프트 Q-함수 학습의 조합이 더 강건하고 안정적인 학습 동역학을 이끌어내는가?
- RQ53D 히우먼로이드 이동과 같은 다양한 상태 공간과 행동 공간 차원을 가진 작업들에 대해 DSPG는 효과적으로 일반화될 수 있는가?
주요 결과
- DSPG는 Ant-v2, HalfCheetah-v2, Hopper-v2, Walker2d-v2의 네 가지 벤치마크 환경 전반에서 DDPG보다 최종 성능과 샘플 효율성 측면에서 뚜렷한 우월성을 보였다.
- Hopper-v2와 Walker2d-v2에서 DSPG는 평균 총 보상이 각각 3674.029와 6060.884로, SAC의 3652.893과 5520.419보다 높았다.
- Ant-v2에서 DSPG는 최고 평균 총 보상 3384.074를 기록하여 DDPG(1012.242)를 압도하고 SAC의 최고 성능 3472.346과도 동등한 성능을 달성했다.
- 학습 곡선을 분석한 결과, DSPG는 변동성이 적고 모든 작업에서 일관된 향상 추세를 보이며 SAC보다 뛰어난 안정성을 확보했다.
- 클리핑된 소프트 정책 그래데이언트와 더블 샘플링을 적용한 단일 크리틱의 조합이 근사 오차 감소와 학습 안정성 향상에 기여했다.
- 단일 크리틱을 사용하고도, 두 개의 크리틱을 필요로 하는 SAC와 비교해 성능이 유사하게 유지되었으며, 이는 더블 샘플링 접근법의 효과성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.