Skip to main content
QUICK REVIEW

[논문 리뷰] Online Hyper-parameter Tuning in Off-policy Learning via Evolutionary Strategies

Yunhao Tang, Krzysztof Choromański|arXiv (Cornell University)|2020. 06. 13.
Reinforcement Learning in Robotics참고 문헌 38인용 수 5
한 줄 요약

이 논문은 온라인 초파rameter 튜닝을 위한 진화 전략(OHT-ES)을 제안하며, 이는 오프-폴리시 강화 학습에서 실시간으로 초파라미터를 적응시키는 프레임워크이다. 훈련 중에 n-스텝 리턴과 학습률과 같은 핵심 초파라미터를 진화 전략을 통해 튜닝함으로써, 다양한 연속 제어 벤치마크에서 정적 초파라미터와 이전 방법들보다 일관된 성능 향상을 달성한다.

ABSTRACT

Off-policy learning algorithms have been known to be sensitive to the choice of hyper-parameters. However, unlike near on-policy algorithms for which hyper-parameters could be optimized via e.g. meta-gradients, similar techniques could not be straightforwardly applied to off-policy learning. In this work, we propose a framework which entails the application of Evolutionary Strategies to online hyper-parameter tuning in off-policy learning. Our formulation draws close connections to meta-gradients and leverages the strengths of black-box optimization with relatively low-dimensional search spaces. We show that our method outperforms state-of-the-art off-policy learning baselines with static hyper-parameters and recent prior work over a wide range of continuous control benchmarks.

연구 동기 및 목표

  • 오프-폴리시 강화 학습의 초파라미터 선택에 대한 불안정성과 민감성 문제를 해결하기 위해.
  • 메타기울기 방법이 적용되지 않는 오프-폴리시 알고리즘에서 온라인 실시간 초파라미터 적응을 위한 방법을 개발하기 위해.
  • 오프-폴리시 환경에서 저차원의 블랙박스 초파라미터 최적화에 진화 전략의 장점을 활용하기 위해.
  • 훈련 중에 n-스텝 리턴과 학습률과 같은 초파라미터를 동적으로 적응시킴으로써 샘플 효율성과 훈련 안정성을 향상시키기 위해.
  • 정적 및 이전의 적응형 기준과 비교하여 다양한 연속 제어 환경에서 일관된 성능 향상을 입증하기 위해.

제안 방법

  • 이 방법은 훈련 중 실시간으로 n-스텝 리턴과 학습률과 같은 초파라미터를 최적화하기 위해 진화 전략(ES)을 사용한다.
  • 초파라미터는 효율적인 ES 기반 최적화를 가능하게 하는 좁은 검색 공간 내에서 조정 가능한 변수로 간주된다.
  • 이 프레임워크는 기반 오프-폴리시 알고리즘에 관계없이 적용 가능하므로, TD3와 SAC와 같은 기존 알고리즘과의 통합이 가능하다.
  • ES 업데이트는 누적 수익에서 유도된 대체 목표를 기반으로 환경의 성능 피드백을 사용하여 수행된다.
  • 이 방법은 강화 학습 목표를 통한 역전파를 피하기 때문에, 벨먼 오차와 같은 프록시 목표를 가진 알고리즘에도 적용 가능하다.
  • 이 방법은 이산 및 연속 초파라미터를 모두 지원하며, 실험은 주로 n-스텝 리턴과 학습률에 집중한다.

실험 결과

연구 질문

  • RQ1진화 전략이 오프-폴리시 강화 학습에서 온라인 초파라미터 튜닝에 효과적으로 적용될 수 있는가?
  • RQ2ES를 통한 온라인 초파라미터 적응이 오프-폴리시 알고리즘에서 정적 초파라미터에 비해 일관된 성능 향상을 이끌어낼 수 있는가?
  • RQ3샘플 효율성과 성능 측면에서 OHT-ES는 종래의 엔드 투 엔드 ES 기반 정책 최적화(ES-RL)와 어떻게 비교되는가?
  • RQ4n-스텝 리턴과 학습률을 적응시키는 것이 연속 제어 작업에서 훈련 안정성과 최종 성능에 어떤 영향을 미치는가?
  • RQ5OHT-ES는 다양한 오프-폴리시 알고리즘과 벤치마크 환경으로 일반화될 수 있는가?

주요 결과

  • OHT-ES는 13개의 시뮬레이션 로케모션 작업 전반에서 정적 초파라미터를 사용하는 오프-폴리시 기준보다 뚜렷이 뛰어나며, 평균, 중앙값, 최고 비율 지표에서 성능 향상을 관찰했다.
  • 초기 훈련에서 적응형 n-스텝 리턴(n=5)이 가장 우수한 성능를 보였지만, OHT-ES를 통한 온라인 적응이 이 기준을 뛰어넘고 장기적으로도 열등한 성능 진전을 유지했다.
  • n-스텝 튜닝을 적용한 OHT-ES는 DMWalkerRun에서 평균 성능 757±7을 기록했으며, 정적 TD3 기준(274±200)과 심지어 SAC(23±1)를 뛰어넘었다.
  • Ant 작업에서는 n-스텝 튜닝을 적용한 OHT-ES가 2273±1107을 기록했고, 최고 성능 기준(TD3)은 3968±801이었으며, 이는 OHT-ES가 강력한 기준을 따라하거나 뛰어넘을 수 있음을 보여준다.
  • 학습률 적응을 적용한 OHT-ES는 Ant에서 3526±1162를 기록했으며, TD3 기준(3968±801)과 ES-RL 기준(2289±181)을 모두 뛰어넘었다.
  • HalfCheetah 작업에서는 n-스텝 튜닝을 적용한 OHT-ES가 10758±397을 기록했고, 최고 성능 기준(SAC: 11451±406)을 초월하여 다양한 작업 간 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.