Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum Mutation Reinforcement Learning for Scalable Control

Karush Suri, Xiao Qi Shi|arXiv (Cornell University)|2020. 07. 24.
Reinforcement Learning in Robotics참고 문헌 41인용 수 9
한 줄 요약

이 논문은 진화 전략(ES)을 탐색에 사용하고 소프트 액터-크리틱(SAC)을 정책 최적화에 사용하는 확장 가능한 강화학습 알고리즘인 진화 기반 소프트 액터-크리틱(ESAC)을 제안한다. 자동 돌연변이 조정(AMT)과 후회 기반 교배 기법을 통합함으로써, ESAC는 MuJoCo 및 딥마인드 컨트롤 스위트 작업에서 최신 기준 성능을 달성하였으며, 에피소드당 벽시계 시간을 60% 감소시키고 하이퍼파라미터 민감도에 대한 강건성을 향상시켜 샘플 효율성과 확장성 면에서 SAC를 초월한다.

ABSTRACT

Advances in Reinforcement Learning (RL) have demonstrated data efficiency and optimal control over large state spaces at the cost of scalable performance. Genetic methods, on the other hand, provide scalability but depict hyperparameter sensitivity towards evolutionary operations. However, a combination of the two methods has recently demonstrated success in scaling RL agents to high-dimensional action spaces. Parallel to recent developments, we present the Evolution-based Soft Actor-Critic (ESAC), a scalable RL algorithm. We abstract exploration from exploitation by combining Evolution Strategies (ES) with Soft Actor-Critic (SAC). Through this lens, we enable dominant skill transfer between offsprings by making use of soft winner selections and genetic crossovers in hindsight and simultaneously improve hyperparameter sensitivity in evolutions using the novel Automatic Mutation Tuning (AMT). AMT gradually replaces the entropy framework of SAC allowing the population to succeed at the task while acting as randomly as possible, without making use of backpropagation updates. In a study of challenging locomotion tasks consisting of high-dimensional action spaces and sparse rewards, ESAC demonstrates improved performance and sample efficiency in comparison to the Maximum Entropy framework. Additionally, ESAC presents efficacious use of hardware resources and algorithm overhead. A complete implementation of ESAC can be found at karush17.github.io/esac-web/.

연구 동기 및 목표

  • 고차원 행동 공간과 장수명 작업에서 딥 강화학습(RL) 알고리즘의 확장성 한계를 해결하기 위해.
  • 돌연변이 비율과 인구 동역학에서 진화 전략(ES)의 하이퍼파라미터 민감도 문제를 극복하기 위해.
  • 백프로파게이션에 의존하지 않고도 효율적이고 확장 가능한 탐색을 가능하게 하면서도, SAC의 샘플 효율성과 성능를 유지하기 위해.
  • ES 기반 탐색에서 소프트 승자 선택과 후회 기반 교배를 통해 기술 이동성과 인구의 강건성을 향상시키기 위해.
  • 백프로파게이션 빈도를 동적으로 감소시킴으로써 SAC에 대한 기울기 업데이트 의존도를 줄이면서도 성능를 유지하기 위해.

제안 방법

  • ESAC는 탐색(ES 기반)과 이용(SAC 기반)을 분리하여, ES로 정책 가중치를 진화시키고, SAC로 기울기 업데이트를 통해 이를 정밀화한다.
  • 자동 돌연변이 조정(AMT)을 도입하여, 클리핑된 영역 ζ 내에서 돌연변이 비율 σ를 점진적으로 증가시켜, 백프로파게이션 없이도 탐색을 향상시킨다.
  • 소프트 승자 선택은 최상의 후손을 복제 대상으로 선정하면서도 여전히 돌연변이를 적용함으로써 정체를 방지하고 기술 이동을 가능하게 한다.
  • 후회 기반 교배 기법은 평가 이후 후손 간에 우세한 특성을 이동시켜, 유전적 재조합을 통해 인구 수준의 성능 향상을 이룬다.
  • SAC 기울기 업데이트 횟수는 시간이 지남에 따라 지수적으로 감소시키며, 계산 오버헤드를 줄이면서도 학습 진전을 유지한다.
  • 알고리즘은 다양한 인구 크기와 돌연변이 비율을 사용하여 MuJoCo 및 딥마인드 컨트롤 스위트 환경에서 평가되어 확장성과 강건성을 점검한다.

실험 결과

연구 질문

  • RQ1ES와 SAC를 융합한 하이브리드 RL 방법이 고차원 제어 작업에서 높은 샘플 효율성과 확장성을 동시에 달성할 수 있는가?
  • RQ2백프로파게이션을 사용하지 않고도 자동 돌연변이 조정(AMT)이 진화 전략의 하이퍼파라미터 민감도를 어떻게 향상시키는가?
  • RQ3후회 기반 교배와 소프트 승자 선택이 ES 기반 RL에서 기술 이동성과 인구 수준 성능 향상에 얼마나 기여하는가?
  • RQ4SAC 기울기 업데이트 빈도를 감소시키는 것이 ES 기반 탐색과 조합되었을 때 성능 저하를 초래하는가?
  • RQ5어려운 이동 작업에서 ESAC는 벽시계 시간과 샘플 효율성 면에서 SAC 및 표준 ES에 비해 어떻게 비교되는가?

주요 결과

  • ESAC는 MuJoCo 및 딥마인드 컨트롤 스위트 작업 중 15개 중 10개에서 최신 기준 성능을 달성하였으며, 다양한 하이라인드 버전을 포함한다.
  • SAC 대비 평균 에피소드당 벽시계 시간을 약 60% 감소시켜 CPU 자원에서 뛰어난 확장성 잠재력을 입증하였다.
  • AMT 덕분에 ζ 범위(10⁻⁴에서 10⁻²) 내에서 강건한 성능가지며, ζ ≥ 0.1일 경우에만 심각한 민감도가 관찰되어 하이퍼파라미터 저항력 향상이 확인되었다.
  • 후회 기반 교배와 소프트 승자 선택은 최상의 에이전트를 돌연변이에서 보호하지 않으면서도 우세한 기술 이동을 가능하게 하여 인구 수준의 성능 향상을 이뤘다.
  • SAC보다 훨씬 적은 백프로파게이션 업데이트를 수행함으로써 기울기 기반 최적화에 대한 의존도를 감소시켰으며, 샘플 효율성은 유지하거나 향상시켰다.
  • 다양한 인구 크기와 돌연변이 비율에서도 성능를 유지함으로써 확장성과 효율적인 하드웨어 활용 능력을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.