Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting Behaviour for Learning Progress

Tom Schaul, Diana Borsa|arXiv (Cornell University)|2019. 12. 14.
Advanced Bandit Algorithms Research참고 문헌 41인용 수 8
한 줄 요약

이 논문은 강화학습 중에 에이전트의 탐색 행동을 자동으로 적응시키기 위한 방법을 제안한다. 비정상적인 다중 손잡이 슬롯머신을 사용하여 학습 진행도의 Proxy를 기반으로 스위치성, 낙관성, 일관성 등의 정책 조정 방식을 동적으로 선택한다. 이 방법은 수작업으로 최적화된 초기화 조정값을 사용한 성능에 비해 비용을 훨씬 줄이며, 수동 조정이나 추가 학습 런을 필요로 하지 않는다.

ABSTRACT

Determining what experience to generate to best facilitate learning (i.e. exploration) is one of the distinguishing features and open challenges in reinforcement learning. The advent of distributed agents that interact with parallel instances of the environment has enabled larger scales and greater flexibility, but has not removed the need to tune exploration to the task, because the ideal data for the learning algorithm necessarily depends on its process of learning. We propose to dynamically adapt the data generation by using a non-stationary multi-armed bandit to optimize a proxy of the learning progress. The data distribution is controlled by modulating multiple parameters of the policy (such as stochasticity, consistency or optimism) without significant overhead. The adaptation speed of the bandit can be increased by exploiting the factored modulation structure. We demonstrate on a suite of Atari 2600 games how this unified approach produces results comparable to per-task tuning at a fraction of the cost.

연구 동기 및 목표

  • 강화학습에서 수작업으로 조정하는 초깃값 설정에 대한 의존도를 줄이기 위해 탐색 행동의 자동 적응을 가능하게 한다.
  • 학습 진행도를 극대화하는 정책 조정 방식을 동적으로 선택하여 샘플 효율성을 향상시킨다.
  • 분산 강화학습 에이전트에서 행동 적응을 위한 확장 가능하고 저비용의 메커니즘을 개발한다.
  • 통합된 적응형 접근 방식이 다양한 Atari 2600 환경에서 작업별 최적화된 성능을 도달하거나 초월할 수 있음을 입증한다.

제안 방법

  • 이 방법은 비정상적인 다중 손잡이 슬롯머신을 사용하여 스위치성, 옵티즘, 일관성 등의 정책 조정 방식(예: 온도, 에프실론-그리디, 액션별 편향)을 동적으로 선택한다.
  • 각 조정 방식은 에피소드당 한 번 적용되며, 전체 동안 고정되어 경험 수집 중 일관된 행동 변화를 보장한다.
  • 학습 진행도의 Proxy인 $ f(z) $ 는 양자분포 기반의 가치 함수 근사치의 변화를 기반으로 각 조정 방식 $ z $ 에 대해 추정된다.
  • 적응 속도를 높이기 위해 밴딧은 요인 분해된 구조를 사용하여 조정 공간의 효율적 탐색을 가능하게 한다.
  • 에이전트의 정책은 양자 기반의 분포 강화학습 알고리즘을 사용하여 업데이트되며, 행동 정책은 학습된 매개변수 $ \theta $ 와 조정 벡터 $ z $ 를 통해 조정된다.
  • 시스템은 학습 중에 온라인으로 작동하며, 추정된 학습 진행도 Proxy를 극대화하도록 지속적으로 조정을 적응시킨다.

실험 결과

연구 질문

  • RQ1통합된 적응형 행동 조정 방법이 강화학습에서 작업별 최적화된 초깃값 설정 성능에 비슷한 성능을 달성할 수 있는가?
  • RQ2비정상적인 다중 손잡이 슬롯머신이 에이전트의 학습 진행도를 따라가며 탐색 행동을 최적화하는 데 얼마나 효과적인가?
  • RQ3스위치성과 낙관성 등의 정책 조정 방식을 동적으로 적응시킴으로써 다양한 환경에서 샘플 효율성이 향상되는가?
  • RQ4이 방법은 학습 성능을 유지하거나 향상시키면서 얼마나 많은 수작업 조정의 필요성을 줄일 수 있는가?

주요 결과

  • 제안된 방법은 다양한 Atari 2600 게임에서 수작업 최적화된 초깃값 설정 성능에 근사하는 성능을 달성하며, 수동 조정이 필요하지 않다.
  • 밴딧 기반의 조정 방식 적응은 현재 학습 단계에 맞는 데이터 생성에 집중함으로써 샘플 효율성 향상에 기여한다.
  • 이 방법은 광범위한 초깃값 검색의 필요성을 줄이며, 학습 중에 최적의 행동 조정 방식을 자동으로 선택한다.
  • 요인 분해된 밴딧 구조를 사용함으로써 학습 동역학의 변화에 신속하게 적응할 수 있어 학습 진행도 변화에 대한 반응성이 향상된다.
  • 고정된 조정 방식 기반의 베이스라인보다 성능이 뛰어나며, 실험 결과 최적의 고정된 조정 방식 설정과도 동등하거나 이를 초월한다.
  • 이 방법은 계산적으로 효율적이며 확장 가능하며, 최소한의 오버헤드를 가지므로 대규모 분산 강화학습 학습에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.