Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning in Feature Space: Matrix Bandit, Kernels, and Regret Bound

Lin F. Yang, Mengdi Wang|arXiv (Cornell University)|2019. 05. 24.
Reinforcement Learning in Robotics인용 수 95
한 줄 요약

MatrixRL을 소개하는 온라인 강화학습 알고리즘으로, 특징 공간에서 저차원 전이 코어를 학습하고(커널화 버전도) 특징 차원에 의존하는 거의 최적에 가까운 후회(bound)를 달성하며 상태-동작 공간의 크기가 아니라 특징 차원에 의존한다.

ABSTRACT

Exploration in reinforcement learning (RL) suffers from the curse of dimensionality when the state-action space is large. A common practice is to parameterize the high-dimensional value and policy functions using given features. However existing methods either have no theoretical guarantee or suffer a regret that is exponential in the planning horizon $H$. In this paper, we propose an online RL algorithm, namely the MatrixRL, that leverages ideas from linear bandit to learn a low-dimensional representation of the probability transition model while carefully balancing the exploitation-exploration tradeoff. We show that MatrixRL achieves a regret bound ${O}\\big(H^2d\\log T\\sqrt{T}\\big)$ where $d$ is the number of features. MatrixRL has an equivalent kernelized version, which is able to work with an arbitrary kernel Hilbert space without using explicit features. In this case, the kernelized MatrixRL satisfies a regret bound ${O}\\big(H^2\\widetilde{d}\\log T\\sqrt{T}\\big)$, where $\\widetilde{d}$ is the effective dimension of the kernel space. To our best knowledge, for RL using features or kernels, our results are the first regret bounds that are near-optimal in time $T$ and dimension $d$ (or $\\widetilde{d}$) and polynomial in the planning horizon $H$.

연구 동기 및 목표

  • RL에서 차원의 저주를 특징 표현을 활용하여 증명 가능한 탐사 효율성을 달성한다.
  • 회귀 및 낙관적 계획을 통해 저차원 전이 코어를 학습하는 온라인 RL 알고리즘을 개발한다.
  • 무한 차원 특징 표현을 다루기 위해 커널 공간으로 접근을 확장한다.
  • 상태-동작 공간의 크기가 아니라 특징 수(또는 유효 커널 차원)에 비례하여 확장되는 후회 바운드를 제공한다.

제안 방법

  • 전이 다이내믹스를 M* 코어 행렬로 모델링하여 P(·|s,a)=φ(s,a)ᵀ M* ψ(·)로 표현한다.
  • (2)에 따라 릿지 회귀를 사용해 M*를 추정하고 M_n을 형성한다.
  • 탐사와 활용의 균형을 맞추기 위해 행렬 신뢰 구(B_n)를 이용해 낙관적 Q-함수를 구성한다(Eq. 4).
  • 두 가지 후회 상한을 제시한다: 행렬 노름 2→1를 사용하는 정리 1과 Frobenius 노름 구(B_n)을 사용하는 정리 2로 각각 O(H² d^{3/2} √T) 또는 O(H² d √T) 후회를 보인다.
  • 명시적 특징을 커널 k_φ와 k_ψ로 대체하여 MatrixRL을 커널화하고 KernelMatrixRL을 얻으며 후회는 O(H² ẑ√T)이고 ẑ는 유효 커널 차원(정리 3)이다.
  • 닫힌 형식의 신뢰 구간 및 공간 복잡도 O(d²)를 포함한 실용적 구현 노트를 제공한다.

실험 결과

연구 질문

  • RQ1특징 기반 표현이 전체 상태-동작 공간에 의존하지 않는 후회 바운드로 RL에서 효율적 탐사를 가능하게 할 수 있는가?
  • RQ2릿지 회귀를 사용해 전이 코어를 추정하고 신뢰 구를 사용해 특징 공간에서 낙관적 RL을 달성하는 방법은?
  • RQ3커널화된 버전이 이러한 보장을 무한 차원 특징 공간으로 확장하고 결과적 후회는 무엇인가?
  • RQ4특징 차원 d(또는 유효 커널 차원 ẑ) 및 수평선 H에 대한 구체적 후회 바운드는 무엇인가?
  • RQ5고차원 문제에서도 제시된 접근이 실제로 효율적으로 구현될 수 있는가?

주요 결과

  • MatrixRL은 더 강한 제약 하에서 정리 2로 O(H² d √T)도 가능하며 정리 1에서는 O(H² d log T √T) 후회를 달성한다.
  • KernelMatrixRL은 ẑ가 유효 커널 차원일 때 O(H² ẑ log T √T)의 후회를 달성한다.
  • 후회 바운드는 시간 T와 차원 d(또는 ẑ)에서 거의 최적이며 계획 수명 H에 다항적으로 의존하고 상태-동작 공간의 크기에 의존하지 않는다.
  • 알고리즘은 공간 O(d²)에서 동작하고 한 단계당 닫힌 형식으로 업데이트된다.
  • 커널화된 버전은 커널을 통해 무한 차원 공간도 다룰 수 있으며 유효 차원에 대해 시간 T에 대해 차등하의 후회를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.