Skip to main content
QUICK REVIEW

[논문 리뷰] Tuning Mixed Input Hyperparameters on the Fly for Efficient Population Based AutoRL

Jack Parker-Holder, Loc Nguyen|arXiv (Cornell University)|2021. 06. 30.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 인구 기반 강화학습에서 연속적이고 범주형 하이퍼파rameter를 효율적으로 최적화할 수 있도록 PB2를 확장한 계층적이고 시간에 따라 변하는 밴딧 알고리즘을 제안한다. 데이터 증강(범주형)과 학습률(연속형) 간의 종속성을 모델링함으로써, 이론적으로 하위선형 잔여도 보장을 갖는 Procgen 벤치마크에서 개선된 일반화 성능을 달성한다.

ABSTRACT

Despite a series of recent successes in reinforcement learning (RL), many RL algorithms remain sensitive to hyperparameters. As such, there has recently been interest in the field of AutoRL, which seeks to automate design decisions to create more general algorithms. Recent work suggests that population based approaches may be effective AutoRL algorithms, by learning hyperparameter schedules on the fly. In particular, the PB2 algorithm is able to achieve strong performance in RL tasks by formulating online hyperparameter optimization as time varying GP-bandit problem, while also providing theoretical guarantees. However, PB2 is only designed to work for continuous hyperparameters, which severely limits its utility in practice. In this paper we introduce a new (provably) efficient hierarchical approach for optimizing both continuous and categorical variables, using a new time-varying bandit algorithm specifically designed for the population based training regime. We evaluate our approach on the challenging Procgen benchmark, where we show that explicitly modelling dependence between data augmentation and other hyperparameters improves generalization.

연구 동기 및 목표

  • PB2가 연속적 하이퍼파rameter만 최적화할 수 있다는 한계를 해결하기 위해, 인구 기반 학습에서 연속적이고 범주형 하이퍼파라미터를 효율적으로 공동 최적화할 수 있도록 하는 것.
  • 강화학습에서 일반화 성능을 향상시키기 위해 범주형 하이퍼파라미터(예: 데이터 증강 유형)와 연속형 하이퍼파라미터(예: 학습률) 간의 종속성을 명시적으로 모델링하는 것.
  • 하위선형 잔여도 보장을 갖는 이론적으로 효율적인 계층적 밴딧 알고리즘을 개발하여 시간에 따라 변하는 하이퍼파라미터 스케줄링을 지원하는 것.
  • 어려운 Procgen 벤치마크에 이 방법을 적용하고, 무작위 검색 기반 베이스라인 대비 성능 향상을 입증하는 것.

제안 방법

  • 인구 기반 학습 환경에서 연속적이고 범주형 하이퍼파라미터를 모두 지원하는 새로운 시간에 따라 변하는 배치 다중권문 밴딧 알고리즘을 도입한다.
  • 범주형 하이퍼파라미터를 먼저 선택하고, 선택된 범주에 따라 조건부로 연속형 하이퍼파라미터 최적화를 수행하는 계층적 설계를 제안한다.
  • 연속형, 범주형, 시간에 따라 변하는 구성요소를 포함하는 복합 커널 함수를 사용한다: $k_z = (1- heta)k_{ ext{Continuous}}k_{ ext{time1}} + \theta k_{ ext{Categorical}}k_{ ext{time2}}$, 여기서 $\theta$는 혼합 비율을 제어한다.
  • 구조화된 커널을 사용한 GP-bandit 프레임워크를 활용하여 하이퍼파라미터 간의 상호의존성을 모델링하고 효율적인 탐색을 가능하게 한다.
  • GP 모델의 로그-주변 가능도를 통해 역전파를 이용해 하이퍼파라미터 최적화를 위한 기울기를 유도한다.
  • PBT에서 온라인 하이퍼파라미터 스케줄링에 이 방법을 적용하여, 이론적 잔여도 한계를 갖는 학습 도중 실시간 적응을 가능하게 한다.

실험 결과

연구 질문

  • RQ1시간에 따라 변하는 밴딧 알고리즘이 인구 기반 RL 환경에서 연속적이고 범주형 하이퍼파라미터를 효율적으로 최적화할 수 있는가?
  • RQ2데이터 증강(범주형)과 학습률(연속형) 하이퍼파라미터 간의 종속성을 명시적으로 모델링하면 강화학습에서 일반화 성능이 향상되는가?
  • RQ3제안된 계층적 밴딧 접근법은 범주형과 연속형 변수를 혼합하는 상황에서도 하위선형 잔여도 보장을 갖는 이론적으로 효율적인가?
  • RQ4이 방법은 복잡한 벤치마크인 Procgen에 어떻게 스케일링되며, 샘플 효율성과 성능 측면에서 무작위 검색 기반 베이스라인과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 하이퍼파라미터 최적화에서 하위선형 잔여도를 달성하여, PB2의 이론적 보장을 혼합 하이퍼파라미터 공간으로 확장한다.
  • 데이터 증강 유형과 학습률 간의 종속성을 명시적으로 모델링함으로써, 증강 유형에 대한 무작위 검색 대비 Procgen 벤치마크에서 더 뛰어난 일반화 성능을 달성한다.
  • 계층적 밴딧 접근법은 범주형 및 연속형 하이퍼파라미터 상호작용을 효과적으로 활용함으로써 표준 PBT 및 PB2보다 샘플 효율성이 뛰어나다.
  • 실험 결과는 하이퍼파라미터 스케줄이 증강 유형을 고려할 경우, 다양한 Procgen 환경에서 더 우수한 일반화 성능을 보임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.