Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Basis Function Adaptation for Reinforcement Learning

Edward W. Barker, Charl Ras|arXiv (Cornell University)|2017. 03. 03.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 강화학습을 위한 비지도 기반 함수 적응 방법인 PASA(확률적 적응적 상태 집합)를 제안한다. 이 방법은 방문 빈도에 따라 동적으로 상태 집합을 정밀화하며, 방문 빈도가 높은 상태에 더 많은 집합을 할당한다. $ X \geq K\sqrt{S}\ln S\log_2 S $ 일 때, 정책과 전이 동역학에 대한 약한 가정 하에 $ O(X\log_2 S) $의 공간 복잡도와 무시할 만한 시간 복잡도로 근사적으로 영점 평균 제곱 벨먼 오차를 보장한다.

ABSTRACT

When using reinforcement learning (RL) algorithms to evaluate a policy it is common, given a large state space, to introduce some form of approximation architecture for the value function (VF). The exact form of this architecture can have a significant effect on the accuracy of the VF estimate, however, and determining a suitable approximation architecture can often be a highly complex task. Consequently there is a large amount of interest in the potential for allowing RL algorithms to adaptively generate approximation architectures. We investigate a method of adapting approximation architectures which uses feedback regarding the frequency with which an agent has visited certain states to guide which areas of the state space to approximate with greater detail. This method is "unsupervised" in the sense that it makes no direct reference to reward or the VF estimate. We introduce an algorithm based upon this idea which adapts a state aggregation approximation architecture on-line. A common method of scoring a VF estimate is to weight the squared Bellman error of each state-action by the probability of that state-action occurring. Adopting this scoring method, and assuming $S$ states, we demonstrate theoretically that - provided (1) the number of cells $X$ in the state aggregation architecture is of order $\sqrt{S}\log_2{S}\ln{S}$ or greater, (2) the policy and transition function are close to deterministic, and (3) the prior for the transition function is uniformly distributed - our algorithm, used in conjunction with a suitable RL algorithm, can guarantee a score which is arbitrarily close to zero as $S$ becomes large. It is able to do this despite having only $O(X \log_2S)$ space complexity and negligible time complexity. The results take advantage of certain properties of the stationary distributions of Markov chains.

연구 동기 및 목표

  • 큰 상태 공간에서의 강화학습 문제에서 가치 함수 추정을 위한 효과적인 근사 아키텍처 선택 문제를 해결하기 위해.
  • 보상 또는 가치 오차 신호에 의존하지 않고도 상태 방문 빈도 기반 비지도 방법이 기저 함수 적응을 효과적으로 이끌 수 있는지 탐색하기 위해.
  • 비지도 적응이 정책 평가에서 임의로 낮은 벨먼 오차를 도출할 수 있는 조건을 이론적으로 확립하기 위해.
  • 이 방법이 최소한의 계산 및 메모리 오버헤드로 높은 정확도를 달성하여 대규모 문제에 실용적으로 적용될 수 있음을 보여주기 위해.

제안 방법

  • PASA는 상태 방문 빈도의 온라인 추정치를 사용하여 상태 집합 셀의 정밀도를 조정하며, 자주 방문되는 상태에 더 많은 셀을 할당한다.
  • 알고리즘은 상태 공간을 $ X $개의 셀로 동적으로 분할하여 방문 빈도가 높은 상태에 더 세밀한 표현을 할당한다.
  • 마르코프 체인의 정적 분포 성질을 활용하여 상태의 기대 방문 수와 방문 수의 분산을 모델링한다.
  • 충분한 셀 수가 확보되면, 모든 고방문 빈도 상태가 결국 개별 셀로 분리되어 근사 오차를 최소화한다.
  • 이론적 분석은 체비셰프 부등식을 사용하여 특정 상태의 방문 수가 임계값을 초과할 확률을 제한함으로써 오차 제어를 가능하게 한다.
  • 수렴 보장을 도출하기 위해 전이 함수에 대해 균일한 사전 분포를 가정하고, 결정성에 가까운 정책을 가정한다.

실험 결과

연구 질문

  • RQ1순수하게 상태 방문 빈도에 기반한 비지도 적응이 정책 평가에서 근사적으로 최적의 정확도를 갖는 가치 함수 근사 결과를 도출할 수 있는가?
  • RQ2상태 공간 크기 $ S $ 가 증가함에 따라 임의로 낮은 벨먼 오차를 보장하기 위해 필요한 최소 집합 수 $ X $ 는 얼마인가?
  • RQ3이 적응 방법의 공간 및 시간 복잡도는 $ S $ 에 따라 어떻게 변화하며, 강력한 이론적 성능을 달성하면서도 효율성을 유지할 수 있는가?
  • RQ4정책과 전이 함수에 대해 어떤 조건이 성립할 경우, 이 방법이 낮은 오차의 가치 함수 추정치로 수렴을 보장하는가?
  • RQ5진짜 가치 함수가 알려지지 않았고 직접적인 오차 신호가 사용되지 않는 조건에서도 이 방법이 정확도를 유지할 수 있는가?

주요 결과

  • $ X \geq K\sqrt{S}\ln S\log_2 S $ 이고 $ K > \sqrt{\pi/8} $ 일 때, $ S \to \infty $ 일 때 평균 제곱 벨먼 오차 $ L \leq \epsilon_2 $ 가 확률 $ 1 - \epsilon_1 $ 이상으로 보장된다.
  • 공간 복잡도는 $ O(X\log_2 S) $ 이며, 시간 복잡도는 무시할 수 있으므로 매우 효율적이다.
  • 상태의 기대 방문 수는 $ \mathrm{E}(C) < \mathrm{E}(C_1)(\ln S + 1) $ 이하로 제한되며, 분산은 $ \mathrm{Var}(C) \leq O(S\ln S) $ 이다. 이는 이론적 한계를 뒷받침한다.
  • 상태 집합 $ \mathcal{C} $ 내의 고방문 빈도 상태들은 $ C\log_2 S \leq X $ 일 때 결국 각각의 개별 셀로 할당되어 해당 상태에 대한 근사 오차가 제거된다.
  • 이론적 보장은 다음과 같은 약한 가정 하에 성립한다: $ X $ 가 충분히 크며, 정책과 전이 함수가 결정성에 가깝고, 전이에 대한 사전 분포가 균일하다.
  • 이 방법은 전이 동역학의 불확실성에 대해 강건하며, 직접적인 가치 함수 오차 추정이 필요 없어 계산 비용을 감소시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.