Skip to main content
QUICK REVIEW

[논문 리뷰] Infinite-Horizon Offline Reinforcement Learning with Linear Function Approximation: Curse of Dimensionality and Algorithm

Lin Chen, Bruno Scherrer|arXiv (Cornell University)|2021. 03. 17.
Reinforcement Learning in Robotics참고 문헌 28인용 수 4
한 줄 요약

이 논문은 무한할행 이른바 오프라인 강화학습에서 선형 함수 근사와 함께 기본적인 샘플 복잡도 하한을 확립하며, $d\gamma^2 > 1$일 경우 차원 $d$에 대해 지수적 의존성을 보이며, 저분포 이탈 조건 하에서 다항 샘플 복잡도를 달성하는 알고리즘을 제안함으로써 유리한 영역에서 차원의 저주를 해결한다.

ABSTRACT

In this paper, we investigate the sample complexity of policy evaluation in infinite-horizon offline reinforcement learning (also known as the off-policy evaluation problem) with linear function approximation. We identify a hard regime $dγ^{2}>1$, where $d$ is the dimension of the feature vector and $γ$ is the discount rate. In this regime, for any $q\in[γ^{2},1]$, we can construct a hard instance such that the smallest eigenvalue of its feature covariance matrix is $q/d$ and it requires $Ω\left(\frac{d}{γ^{2}\left(q-γ^{2} ight)\varepsilon^{2}}\exp\left(Θ\left(dγ^{2} ight) ight) ight)$ samples to approximate the value function up to an additive error $\varepsilon$. Note that the lower bound of the sample complexity is exponential in $d$. If $q=γ^{2}$, even infinite data cannot suffice. Under the low distribution shift assumption, we show that there is an algorithm that needs at most $O\left(\max\left\{ \frac{\left\Vert θ^π ight\Vert _{2}^{4}}{\varepsilon^{4}}\log\frac{d}δ,\frac{1}{\varepsilon^{2}}\left(d+\log\frac{1}δ ight) ight\} ight)$ samples ($θ^π$ is the parameter of the policy in linear function approximation) and guarantees approximation to the value function up to an additive error of $\varepsilon$ with probability at least $1-δ$.

연구 동기 및 목표

  • 무한할행 설정에서 선형 함수 근사와 함께 오프라인 강화학습의 기본 샘플 복잡도 한계를 이해하기 위해.
  • 특징 차원 $d$에 대해 샘플 복잡도가 지수적으로 증가하는 어려운 영역을 식별하기 위해.
  • 특징 공분산 행렬의 최소 고유값과 할인 인자 $\gamma$에 따라 의존하는 샘플 복잡도에 대한 날카로운 하한을 확립하기 위해.
  • 저분포 이탈 조건 하에서 증명 가능하게 샘플 효율적인 알고리즘을 설계하여 다항 샘플 복잡도를 확보하기 위해.
  • 하한과 상한을 재결합하기 위해, 딱딱한 사례가 저분포 이탈 조건을 위반함을 보여주어 모순을 피하기 위해.

제안 방법

  • 특징 공분산 행렬의 최소 고유값이 임의의 $q \in [\gamma^2, 1]$에 대해 $q/d$인 오프라인 정책 평가를 위한 딱딱한 사례를 구성한다.
  • $\varepsilon$-정확도의 가치 함수 근사에 대해 $\Omega\left(\frac{d}{\gamma^2(q - \gamma^2)\varepsilon^2}\exp(\Theta(d\gamma^2))\right)$개의 샘플이 필요하다는 하한을 유도한다.
  • 저분포 이탈 조건 하에서 최소 제곱 정책 평가(LSPE) 알고리즘을 도입한다.
  • 벨먼 연산자와 특징 공분산 행렬을 포함하는 재귀적 오차 분해를 사용하여 LSPE 알고리즘을 분석한다.
  • 집중 부등식과 스펙트럼 경계를 활용하여 추정 오차를 제어하며, 저분포 이탈 조건을 통해 잘 조절된 특징 행렬을 확보한다.
  • 높은 확률 $1 - \delta$ 하에서 샘플 복잡도 상한을 $O\left(\max\left\{\frac{\|\theta^\pi\|_2^4}{\varepsilon^4}\log\frac{d}{\delta}, \frac{1}{\varepsilon^2}(d + \log\frac{1}{\delta})\right\}\right)$로 도출한다.

실험 결과

연구 질문

  • RQ1무한할행 설정에서 선형 함수 근사와 함께 오프라인 강화학습의 기본 샘플 복잡도 한계는 무엇인가?
  • RQ2특징 공분산 행렬의 최소 고유값이 오프라인 정책 평가의 샘플 복잡도에 어떤 영향을 미치는가?
  • RQ3선형 함수 근사와 함께 오프라인 강화학습에서 차원의 저주를 피할 수 있는 조건은 무엇인가?
  • RQ4저분포 이탈 조건과 같은 현실적인 가정 하에서 증명 가능하게 효율적인 알고리즘을 설계할 수 있는가?
  • RQ5하한과 상한 사이에 격차가 존재하는가, 만약 그렇다면 어떤 구조적 가정이 이를 해결하는가?

주요 결과

  • 만약 $d\gamma^2 > 1$이면, 선형 함수 근사와 함께 오프라인 정책 평가의 샘플 복잡도는 최소 $\Omega\left(\frac{d}{\gamma^2(q - \gamma^2)\varepsilon^2}\exp(\Theta(d\gamma^2))\right)$이며, 이는 $d$에 대해 지수적이다.
  • 특징 공분산 행렬의 최소 고유값이 $\gamma^2/d$이면, 무한한 데이터조차도 정확한 가치 함수 근사 보장을 할 수 없으며, 이는 이전 연구에서의 결과를 복원한다.
  • 저분포 이탈 조건 하에서 LSPE 알고리즘은 $O\left(\max\left\{\frac{\|\theta^\pi\|_2^4}{\varepsilon^4}\log\frac{d}{\delta}, \frac{1}{\varepsilon^2}(d + \log\frac{1}{\delta})\right\}\right)$개의 샘플 상한을 달성한다.
  • $\|\theta^\pi\|_2 \leq O(\sqrt{d})$일 경우, 샘플 복잡도는 $O\left(\frac{d^2}{\varepsilon^4}\log\frac{d}{\delta}\right)$로 줄어들며, 이는 $d$와 $1/\varepsilon$에 대해 다항식이다.
  • 하한을 달성하기 위해 구성된 딱딱한 사례는 저분포 이탈 조건을 만족하지 않으며, 이는 하한과 상한의 일관성을 보장한다.
  • 지수적 의존성은 $d\gamma^2 > 1$ 영역에서 피할 수 없으며, 이는 고차원 오프라인 강화학습에서 선형 함수 근사의 본질적 한계를 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.