Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Algorithm Selection

Romain Laroche, Raphaël Féraud|arXiv (Cornell University)|2017. 01. 30.
Advanced Bandit Algorithms Research인용 수 3
한 줄 요약

이 논문은 온라인 강화학습(RL) 알고리즘 선택을 위한 메타알고리즘인 ESBAS를 제안한다. ESBAS는 에포크 단위로 확률적 밴디트를 사용하여 비정책( off-policy ) RL 알고리즘들 사이에서 동적으로 선택함으로써 샘플 효율성과 성능을 향상시킨다. ESBAS는 거의 최적의 리그레트 한계를 달성하며, 대화, 과일 수확, 아케이드 게임 태스크에서 개별 알고리즘들을 초월하는 경험적 성능을 보인다. 이는 알고리즘과 스텝사이즈 스케줄을 적응적으로 선택함으로써 달성된다.

ABSTRACT

This paper formalises the problem of online algorithm selection in the context of Reinforcement Learning. The setup is as follows: given an episodic task and a finite number of off-policy RL algorithms, a meta-algorithm has to decide which RL algorithm is in control during the next episode so as to maximize the expected return. The article presents a novel meta-algorithm, called Epochal Stochastic Bandit Algorithm Selection (ESBAS). Its principle is to freeze the policy updates at each epoch, and to leave a rebooted stochastic bandit in charge of the algorithm selection. Under some assumptions, a thorough theoretical analysis demonstrates its near-optimality considering the structural sampling budget limitations. ESBAS is first empirically evaluated on a dialogue task where it is shown to outperform each individual algorithm in most configurations. ESBAS is then adapted to a true online setting where algorithms update their policies after each transition, which we call SSBAS. SSBAS is evaluated on a fruit collection task where it is shown to adapt the stepsize parameter more efficiently than the classical hyperbolic decay, and on an Atari game, where it improves the performance by a wide margin.

연구 동기 및 목표

  • 트레이젝터리 수집이 비용이 많이 드는 온라인, 에피소딕 환경에서 가장 샘플 효율적인 RL 알고리즘을 선택하는 문제에 대응한다.
  • 시험·오차 방식의 하이퍼파rameter 튜닝과 실제 RL 응용에서 단일 알고리즘의 비효율성 등의 한계를 극복한다.
  • 이론적 성능 보장을 갖춘 다수의 비정책 RL 알고리즘 간에 견고하고 적응적이며 공정한 선택을 가능하게 하는 메타알고리즘을 설계한다.
  • 빠르게 성능을 내는 알고리즘과 안정적인 알고리즘들을 통합한 선택 프레임워크 내에서 커리큘럼 학습과 수렴 보장을 통합한다.
  • 순수한 RL 수익 이외의 목적 함수, 예를 들어 적응형 하이퍼파rameter 튜닝을 공정한 예산 할당을 통해 가능하게 한다.

제안 방법

  • 다양한 알고리즘 간의 정보 공유를 가능하게 하기 위해 관찰, 행동, 보상의 삼중조로 구성된 통합 상호작용 프로세스를 사용하는 RL 알고리즘의 통합 프레임워크를 제안한다.
  • 시간을 지수적으로 증가하는 에포크로 나누고, 각 에포크 내에서 정책 업데이트를 동결함으로써 안정적인 확률적 밴디트 선택을 허용하는 메타알고리즘 ESBAS를 도입한다.
  • 각 에포크 내에서 누적 수익을 기반으로 가장 우수한 성능을 보이는 RL 알고리즘을 선택하기 위해 다중 암초 밴디트를 사용한다. 이는 이론적 의사 리그레트 한계를 제공한다.
  • 이론적 분석을 통해 ESBAS가 구조적 샘플링 예산 제약 하에서 거의 최적의 성능을 달성하며, 리그레트가 $ (3K+1) ho_{ ext{abs}}^{ au}(T/3K) + ho_{ss}^{ ext{ESBAS}}(T) + ilde{ ho} ext{log}(T) $로 제한됨을 보여준다.
  • 모든 전이 이후에 알고리즘을 업데이트하는 진정한 온라인 설정으로 ESBAS를 SSBAS로 개선함으로써 온라인 RL에서 동적 스텝사이즈 적응이 가능해진다.
  • 모든 알고리즘을 모든 트레이젝터리에서 동일하게 훈련함으로써 공정한 평가를 보장하며, 제어에 관계없이 오프-정책 학습을 사용하여 일관된 정책 업데이트를 유지한다.

실험 결과

연구 질문

  • RQ1메타알고리즘이 온라인 에피소딕 RL 환경에서 여러 비정책 RL 알고리즘 간에 동적으로 선택하여 기대 수익을 최대화할 수 있는가?
  • RQ2정책을 동결한 에포크 단위 밴디트 기반 선택이 구조적 샘플링 제약 하에서 이론적 리그레트 보장을 제공하는가?
  • RQ3메타알고리즘이 실제 작업, 예를 들어 대화 시스템과 아케이드 게임에서 개별 RL 알고리즘들을 초월하여 샘플 효율성과 성능을 향상시킬 수 있는가?
  • RQ4클래식한 방법(예: hyperbolic 감쇠)과 비교해 메타알고리즘이 온라인 RL에서 하이퍼파rameter, 특히 스텝사이즈를 어떻게 적응적으로 조정하는가?
  • RQ5빠르게 성능을 내는 알고리즘과 안정적인 알고리즘들을 통합함으로써 커리큘럼 학습과 수렴 보장을 달성할 수 있는가?

주요 결과

  • 대화 정책 학습 태스크에서 ESBAS는 대부분의 구성에서 개별 RL 알고리즘들을 모두 능가하며, 더 높은 샘플 효율성과 수익 최적화를 보였다.
  • 과일 수확 태스크에서 SSBAS는 고전적인 하이퍼볼릭 감쇠보다 스텝사이즈 파rameter를 더 효율적으로 적응시켜 더 빠른 수렴과 향상된 성능를 달성했다.
  • Q*bert 아케이드 게임에서 SSBAS를 통해 다양한 네트워크 깊이와 너비를 가진 여러 DQN 변종을 동시에 실행함으로써 최종 성능이 크게 향상되었다.
  • 이론적 분석을 통해 ESBAS가 $ (3K+1) ho_{ ext{abs}}^{ au}(T/3K) + ho_{ss}^{ ext{ESBAS}}(T) + ilde{ ho} ext{log}(T) $의 상한을 갖는 거의 최적의 리그레트를 달성함을 증명했다. 여기서 $ ilde{ ho} $는 실패 확률과 관련된 상수이다.
  • ESBAS는 높은 확률 $ 1 - ilde{ ho}/ au $로 최고의 알고리즘을 최소 $ au/3K $번 선택함으로써 강력한 경험적 및 이론적 보장을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.