Skip to main content
QUICK REVIEW

[논문 리뷰] Tensor and Matrix Low-Rank Value-Function Approximation in Reinforcement Learning

Sergio Rozada, Antonio G. Marqués|arXiv (Cornell University)|2022. 01. 21.
Tensor decomposition and applications인용 수 4
한 줄 요약

이 논문은 강화학습(RL)에서 가치함수(VF) 추정을 위해 텐서와 행렬의 저질서 근사 방법을 제안하며, 표본 및 계산 복잡도를 줄이기 위해 확률적 온라인 알고리즘을 사용한다. 가치함수를 텐서로 표현하고 PARAFAC 분해를 적용함으로써, 특히 고차원 환경(예: 하이웨이 환경)에서 DQN과 Q-러닝보다 더 빠른 수렴 속도와 더 적은 파라미터 수를 달성한다.

ABSTRACT

Value-function (VF) approximation is a central problem in Reinforcement Learning (RL). Classical non-parametric VF estimation suffers from the curse of dimensionality. As a result, parsimonious parametric models have been adopted to approximate VFs in high-dimensional spaces, with most efforts being focused on linear and neural-network-based approaches. Differently, this paper puts forth a a parsimonious non-parametric approach, where we use stochastic low-rank algorithms to estimate the VF matrix in an online and model-free fashion. Furthermore, as VFs tend to be multi-dimensional, we propose replacing the classical VF matrix representation with a tensor (multi-way array) representation and, then, use the PARAFAC decomposition to design an online model-free tensor low-rank algorithm. Different versions of the algorithms are proposed, their complexity is analyzed, and their performance is assessed numerically using standardized RL environments.

연구 동기 및 목표

  • 비모수적 가치함수 근사에서 차원의 극복 문제를 저질서 구조를 활용하여 해결하기 위해.
  • 저질서 행렬 및 텐서 분해를 사용하여 온라인, 모델 기반, 효율적인 알고리즘을 개발하기 위해.
  • 행렬 기반의 저질서 방법을 다차원 상태-행동 공간으로 일반화하기 위해 텐서 표현을 활용하기 위해.
  • 고차원 환경에서 DQN 및 표본 기반 Q-러닝과 같은 딥 RL 기준선에 비해 표본 및 계산 효율성을 향상시키기 위해.
  • 기존의 고전적 방법으로는 비가능했던 고차원 RL 문제에서 비모수적이고 해석 가능한 VF 추정을 가능하게 하기 위해.

제안 방법

  • 상태-행동 행렬을 고차원 배열로 재구성함으로써 가치함수를 텐서(다중 방향 배열)로 표현한다.
  • 가치함수 텐서에 저질서 구조를 강제하기 위해 PARAFAC(CANDECOMP) 텐서 분해를 적용한다.
  • 시간 차분 학습 원리를 사용하여 저질서 성분을 업데이트하기 위한 확률적 온라인 알고리즘을 개발한다.
  • 교차 최소 제곱법과 점진적 업데이트를 사용하여 온라인 학습 중 저질서 구조를 유지한다.
  • 정확도와 복잡도 사이의 균형을 맞추기 위해 다양한 랭크 및 해상도 설정을 가진 알고리즘의 여러 변종을 도입한다.
  • 연속적인 상태-행동 공간을 텐서 표현에 적합한 이산 그리드로 매핑하기 위해 이산화 전략을 활용한다.

실험 결과

연구 질문

  • RQ1저질서 행렬 근사가 강화학습에서 온라인 가치함수 추정의 표본 및 계산 효율성을 향상시킬 수 있는가?
  • RQ2고차원 상태-행동 공간에서 텐서 기반 저질서 표현이 행렬 기반 및 딥 러닝 기반 방법보다 어떻게 우월한가?
  • RQ3표준 RL 환경에서 텐서의 랭크와 해상도가 수렴 속도와 최종 성능에 어떤 영향을 미치는가?
  • RQ4확률적이고 온라인 저질서 알고리즘이 DQN과 Q-러닝보다 더 빠른 수렴을 달성하면서도 더 적은 표본 수를 요구할 수 있는가?
  • RQ5가치함수의 저질서 구조가 고차원 RL 문제에서 효율적이고 비모수적 학습을 얼마나 잘 가능하게 하는가?

주요 결과

  • 텐서 저질서(TLR) 알고리즘은 배치 크기가 32인 DQN보다 수렴 속도가 더 빠르며, 큰 상태-행동 공간에서 Q-러닝보다도 뚜렷하게 더 빠르게 수렴한다.
  • 9차원 연속 상태를 가진 하이웨이 환경에서 TLR 학습은 더 적은 파라미터와 더 빠른 수렴 속도를 바탕으로 DQN을 능가한다.
  • 더 높은 파라미터 수를 가진 TLR 알고리즘은 평균 에피소드 수익이 가장 높고 수렴 속도도 가장 빠르며, 1개 샘플 배치를 사용한 DQN은 국소 최적점에 갇혀 있었다.
  • DQN은 유사한 수익을 달성하기 위해 상당히 더 많은 표본이 필요했으며, 제안된 TLR 방법에 비해 더 높은 표본 복잡도를 보였다.
  • 모든 표준 환경에서 TLR 및 MLR 알고리즘의 에피소드 평균 단계 수는 DQN 및 Q-러닝보다 낮았다.
  • 누적 보상의 분포를 분석한 결과, TLR 및 MLR는 특히 고배치 DQN 설정에서 Q-러닝 및 DQN을 일관되게 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.