Skip to main content
QUICK REVIEW

[논문 리뷰] No-Regret Reinforcement Learning with Heavy-Tailed Rewards

Vincent Zhuang, Yanan Sui|arXiv (Cornell University)|2021. 02. 25.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 4
한 줄 요약

이 논문은 유한한 $(1+\epsilon)$-차 모멘트를 갖는 무거운 尾보를 가진 MDPs를 위한 강화학습 알고리즘인 Heavy-UCRL2와 Heavy-Q-Learning을 제안한다. 중앙값의 평균 기법과 같은 강건한 평균 추정 기법을 활용하여, 보상 추정이 학습의 어려움을 주도하는 중간 무거운 꼬리 설정에서 근사 최적의 리그레트 한계를 달성한다. 이 접근법은 Heavy-DQN을 통해 딥 강화학습으로 일반화되어 합성 및 표준 벤치마크에서 기존 방법들을 능가한다.

ABSTRACT

Reinforcement learning algorithms typically assume rewards to be sampled from light-tailed distributions, such as Gaussian or bounded. However, a wide variety of real-world systems generate rewards that follow heavy-tailed distributions. We consider such scenarios in the setting of undiscounted reinforcement learning. By constructing a lower bound, we show that the difficulty of learning heavy-tailed rewards asymptotically dominates the difficulty of learning transition probabilities. Leveraging techniques from robust mean estimation, we propose Heavy-UCRL2 and Heavy-Q-Learning, and show that they achieve near-optimal regret bounds in this setting. Our algorithms also naturally generalize to deep reinforcement learning applications; we instantiate Heavy-DQN as an example of this. We demonstrate that all of our algorithms outperform baselines on both synthetic MDPs and standard RL benchmarks.

연구 동기 및 목표

  • MDP에서 중간 무거운 꼬리 보상 분포를 가진 강화학습에 대한 이론적 및 실험적 연구 부족을 해결하기 위해.
  • 중간 무거운 꼬리 보상 학습이 전이 확률 학습을 초월하여 학습의 주요 곤경이 되는지 보여주기 위해.
  • 중간 무거운 꼬리 보상 하에서 근사 최적의 리그레트를 달성하는 신뢰 기반 강화학습 알고리즘인 Heavy-UCRL2와 Heavy-Q-Learning를 설계하고 분석하기 위해.
  • Heavy-DQN를 통해 이 프레임워크를 딥 강화학습으로 확장하여 실용적 적용 가능성을 보여주기 위해.

제안 방법

  • 유한한 $(1+\epsilon)$-차 모멘트만을 갖는 보상에 대해 중앙값의 평균을 통한 강건한 평균 추정을 사용한다.
  • UCRL2와 Q-학습의 표준 신뢰 구간을 중간 무거운 꼬리 분포에 대한 농도 부등식에서 유도된 강건한 대체 구간으로 대체한다.
  • 무한한 중간 무거운 꼬리 설정에서 보상 추정의 곤경이 전이 학습 곤경을 초월함을 증명하기 위한 하한을 구축한다.
  • 강건한 분산과 불확실성 항을 포함한 새로운 분석 프레임워크를 도입하여 중간 무거운 꼬리 보상 하에서 신뢰 기반 알고리즘의 리그레트를 유 bounds 한다.
  • 딥 Q-네트워크에 동일한 강건한 추정 원칙을 적용하여 샘플 효율성과 안정성이 향상된 Heavy-DQN을 도출한다.
  • 합성 MDPs(SixArms, DoubleChain)와 표준 강화학습 벤치마크에서의 실험을 통해 이론적 주장의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1보상 분포가 유한한 $(1+\epsilon)$-차 모멘트만 갖는 중간 무거운 꼬리 분포를 따를 때, MDP 학습의 근본적 곤경은 무엇인가?
  • RQ2강건한 평균 추정 기법은 UCRL2와 Q-학습과 같은 신뢰 기반 강화학습 알고리즘에 효과적으로 적용될 수 있는가?
  • RQ3할인되지 않은 MDP에서 중간 무거운 꼬리 보상 학습의 곤경이 전이 동역학 학습의 곤경을 초월하는가?
  • RQ4강건한 강화학습 알고리즘은 중간 무거운 꼬리 설정에서 근사 최적의 리그레트 한계를 달성할 수 있는가?
  • RQ5강건한 알고리즘은 어떻게 딥 강화학습 아키텍처로 일반화되는가?

주요 결과

  • 논문은 중간 무거운 꼬리 설정에서 전이 확률 학습의 곤경을 초월하여 보상 학습 곤경이 점점 더 지배적이게 되는 이론적 하한을 확립한다.
  • Heavy-UCRL2와 Heavy-Q-Learning는 유한한 $(1+\epsilon)$-차 모멘트를 가정할 때 근사 최적의 리그레트 한계를 달성하며, 尾지수 $\epsilon$ 에 대한 명시적 의존성을 갖는다.
  • 리그레트 한계는 $H^{3}SA\iota^{2}\sqrt{r_{\text{max}}^{3}}$ 와 $H^{\frac{1+3\epsilon}{\epsilon}}\sqrt{S^{3}A^{3}\iota^{4}\epsilon}$ 에 비례하여, 중간 무거운 꼬리 추정의 증가된 복잡성을 반영한다.
  • 동일한 강건한 추정 원칙에서 유도된 Heavy-DQN은 합성 MDP 및 표준 강화학습 벤치마크에서 표준 DQN을 능가한다.
  • SixArms와 DoubleChain MDP에서의 실험 결과는 Heavy-UCRL2와 Heavy-Q-Learning가 표준 기준보다 일관되고 뚜렷한 성능 향상을 보임을 보여준다.
  • 알고리즘은 극단적인 보상 외곽치에 대해 강건성을 유지하며, 보상이 중간 무거운 꼬리 행동을 보일 때에도 안정적인 학습을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.