Skip to main content
QUICK REVIEW

[논문 리뷰] On Reward-Free RL with Kernel and Neural Function Approximations: Single-Agent MDP and Markov Game

Shuang Qiu, Jieping Ye|arXiv (Cornell University)|2021. 10. 19.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 단일 에이전트 MDP와 0-합 마르코프 게임에 대해 커널 및 신경망 함수 근사 기반으로 보장된 효율성을 갖춘 보상 없는 강화 학습 알고리즘을 제안한다. 함수 근사기반에서 유도된 탐색 보너스를 갖춘 낙관적 가치 반복을 활용함으로써, 외부 보상이 주어진 경우 어떤 경우에도 $\widetilde{\mathcal{O}}(1/\varepsilon^{2})$의 샘플 복잡도로 $\varepsilon$-하위최적 정책 또는 $\varepsilon$-근사 넷저 균형을 확보한다.

ABSTRACT

To achieve sample efficiency in reinforcement learning (RL), it necessitates efficiently exploring the underlying environment. Under the offline setting, addressing the exploration challenge lies in collecting an offline dataset with sufficient coverage. Motivated by such a challenge, we study the reward-free RL problem, where an agent aims to thoroughly explore the environment without any pre-specified reward function. Then, given any extrinsic reward, the agent computes the policy via a planning algorithm with offline data collected in the exploration phase. Moreover, we tackle this problem under the context of function approximation, leveraging powerful function approximators. Specifically, we propose to explore via an optimistic variant of the value-iteration algorithm incorporating kernel and neural function approximations, where we adopt the associated exploration bonus as the exploration reward. Moreover, we design exploration and planning algorithms for both single-agent MDPs and zero-sum Markov games and prove that our methods can achieve $\widetilde{\mathcal{O}}(1 /\varepsilon^2)$ sample complexity for generating a $\varepsilon$-suboptimal policy or $\varepsilon$-approximate Nash equilibrium when given an arbitrary extrinsic reward. To the best of our knowledge, we establish the first provably efficient reward-free RL algorithm with kernel and neural function approximators.

연구 동기 및 목표

  • 사전에 지정된 보상이 없는 오프라인 강화 학습에서 샘플 효율적인 탐색 문제를 해결하기 위해.
  • 커널 및 신경망과 같은 비선형 함수 근사기반을 지원하는 통합된 보상 없는 강화 학습 프레임워크를 개발하기 위해.
  • 표본 공간과 선형 설정에서 비선형 함수 근사로의 증명 가능한 효율 알고리즘을 단일 에이전트 MDP와 마르코프 게임 모두에 확장하기 위해.
  • 임의의 외부 보상에 대해 최적의 샘플 복잡도를 확보하는 탐색 및 계획 알고리즘 설계하기 위해.

제안 방법

  • 커널 및 신경망 함수 근사기반을 사용한 최소 제곱 가치 반복의 낙관적 변형을 제안하여 내재 보상으로서 탐색 보너스를 생성한다.
  • 함수 근사에서 유도된 (스케일링된) 보너스를 오프라인 데이터 수집 단계 동안 탐색 보상으로 사용한다.
  • 오직 오프라인 데이터와 주어진 외부 보상만을 사용하여 정책 또는 넷저 균형을 계산하는 계획 단계를 설계한다.
  • 마르코프 게임의 경우, Q-함수로 구성된 행렬 게임을 해결하는 것이 계획 단계를 차지하며, 이는 계산적으로 효율적이다.
  • 커널 및 신경망 함수 공간에서의 농도 불등식과 정규화를 활용하여 추정 오차를 제한하고 일반화를 보장한다.
  • 정규화와 신뢰 구간을 통한 불확실성 측정을 통합하여 비선형 함수 근사 설정에서 탐색을 이끌어내는 데 사용한다.

실험 결과

연구 질문

  • RQ1커널 및 신경망 함수 근사를 사용한 단일 에이전트 MDP에 대해 증명 가능한 효율성을 갖춘 보상 없는 강화 학습 알고리즘을 설계할 수 있는가?
  • RQ2제안된 방법이 비선형 함수 근사 설정에서 $\widetilde{\mathcal{O}}(1/\varepsilon^{2})$의 샘플 복잡도로 $\varepsilon$-하위최적 정책을 학습할 수 있는가?
  • RQ3이 프레임워크는 유사한 샘플 효율성 보장을 갖는 다중 에이전트 0-합 마르코프 게임으로 확장될 수 있는가?
  • RQ4외부 보상 없이 비선형 함수 근사기반과 잘 맞는 탐색 보너스를 효과적으로 설계할 수 있는가?

주요 결과

  • 제안된 알고리즘은 커널 및 신경망 함수 근사를 사용한 단일 에이전트 MDP에서 $\varepsilon$-하위최적 정책을 생성하기 위해 $\widetilde{\mathcal{O}}(1/\varepsilon^{2})$의 샘플 복잡도를 달성한다.
  • 0-합 마르코프 게임의 경우, $\varepsilon$-근사 넷저 균형을 계산하기 위해 $\widetilde{\mathcal{O}}(1/\varepsilon^{2})$의 샘플 복잡도를 확보한다.
  • 마르코프 게임에서의 계획 단계는 Q-함수로 구성된 행렬 게임을 해결하는 것으로 이루어지며, 이는 계산적으로 효율적이며 별도로 관심을 가질 만한 결과이다.
  • 이론적 분석을 통해 알고리즘의 오차 경계가 $\mathcal{O}\left(\beta\sqrt{H^{4}[\Gamma(K,\lambda;\ker_{m})+\log(KH)]}/\sqrt{K}+H^{2}\beta\iota\right)$로 확률적으로 스케일링됨을 입증하였다.
  • 이 방법은 커널 및 신경망을 포함한 비선형 함수 근사기반을 갖춘 보상 없는 강화 학습에서 처음으로 증명 가능한 샘플 효율성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.