Skip to main content
QUICK REVIEW

[논문 리뷰] Online Reinforcement Learning of Optimal Threshold Policies for Markov Decision Processes

Arghyadip Roy, Vivek S. Borkar|arXiv (Cornell University)|2019. 12. 21.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 마르코프 결정 과정(MDP)에서 최적 정책의 순서화된 다중 임계값 구조를 활용하는 구조 인식 온라인 강화학습 알고리즘인 SALMUT을 제안한다. 두 가지 시간스케일의 확률적 근사 방법을 통해 오직 임계값 파라미터만을 학습함으로써, 전통적인 강화학습 방법에 비해 더 빠른 수렴 속도와 감소된 계산 및 저장 복잡도를 달성한다. 이론적으로 최적 정책로의 점근적 수렴이 입증되었고 시뮬레이션을 통해 검증되었다.

ABSTRACT

To overcome the curses of dimensionality and modeling of Dynamic Programming (DP) methods to solve Markov Decision Process (MDP) problems, Reinforcement Learning (RL) methods are adopted in practice. Contrary to traditional RL algorithms which do not consider the structural properties of the optimal policy, we propose a structure-aware learning algorithm to exploit the ordered multi-threshold structure of the optimal policy, if any. We prove the asymptotic convergence of the proposed algorithm to the optimal policy. Due to the reduction in the policy space, the proposed algorithm provides remarkable improvements in storage and computational complexities over classical RL algorithms. Simulation results establish that the proposed algorithm converges faster than other RL algorithms.

연구 동기 및 목표

  • 동적 프로그래밍을 위한 차원의 극복 문제와 모델링 문제를 최적 정책의 구조적 특성을 활용하여 해결하고자 한다.
  • 오직 순서화된 다중 임계값 정책에 집중함으로써 정책 탐색 공간을 줄여 계산 및 저장 효율성을 향상시키고자 한다.
  • 전이 확률에 대한 사전 지식이 필요 없이 점근적으로 최적의 임계값 정책로 수렴하는 온라인 학습 알고리즘을 개발하고자 한다.
  • 이론적 분석과 시뮬레이션을 통해 전통적인 강화학습 알고리즘에 비해 더 빠른 수렴 속도와 낮은 복잡도를 입증하고자 한다.

제안 방법

  • 알고리즘은 두 가지 시간스케일의 확률적 근사 프레임워크를 사용하며, 가치 함수는 빠른 시간스케일에서, 임계값 파라미터는 느린 시간스케일에서 업데이트된다.
  • 임계값 파라미터는 동시에 섭동 확률적 근사(SPSA)를 통해 유도된 평균 보상에 대한 기울기 추정치를 사용하여 업데이트된다.
  • 학습 중에 가치 함수 차이의 단조성 조건을 강제하여 임계값 구조가 유지되도록 한다.
  • 평균 보상이 각 임계값 파라미터에 대해 단모양(unimodal)임을 이용하여 효율적인 기울기 기반 최적화를 가능하게 한다.
  • 완전한 정책 열거를 피하기 위해 학습을 오직 임계값 파라미터로 제한함으로써 탐색 공간을 크게 줄인다.
  • 샘플된 전이 정보를 기반으로 가치 함수 업데이트를 수행하며, 정책 평가와 개선을 반복적으로 수행한다.

실험 결과

연구 질문

  • RQ1최적 정책의 알려진 다중 임계값 구조를 활용하면 MDP의 온라인 강화학습에서 더 빠른 수렴을 이룰 수 있는가?
  • RQ2최적 정책로의 점근적 수렴을 유지하면서 정책 탐색 공간을 효과적으로 줄일 수 있는가?
  • RQ3전통적인 강화학습 알고리즘에 비해 구조 인식 학습이 계산 및 저장 복잡도에 어떤 영향을 미치는가?
  • RQ4샘플링 노이즈가 존재하는 환경에서 확률적 근사 기반의 기울기 기반 임계값 업데이트가 안정적이고 수렴 가능한가?
  • RQ5임계값 파라미터에 대한 평균 보상의 단모양 성질을 활용하여 효율적인 온라인 학습 알고리즘을 설계할 수 있는가?

주요 결과

  • 단계 크기와 샘플링에 대한 표준 가정 하에 SALMUT 알고리즘은 최적의 임계값 정책로 점근적으로 수렴한다.
  • 정책 탐색 공간이 감소함에 따라 전통적인 Q-러닝 및 PDS 기반 방법에 비해 더 빠른 수렴 속도를 달성한다.
  • 모든 상태-행동 쌍에 대한 전체 가치 함수가 아닌 오직 임계값 파라미터만을 학습함으로써 저장 및 계산 복잡도가 크게 감소한다.
  • 각 임계값 파라미터에 대해 평균 보상이 단모양임을 증명하여 기울기 기반 최적화를 효율적으로 수행할 수 있다.
  • 시뮬레이션 결과는 다중 고객 클래스를 가진 유한 버퍼 다중 서버 큐에서 SALMUT이 기준 강화학습 알고리즘보다 더 빠르게 수렴함을 확인한다.
  • 학습 전반에 걸쳐 구조 일致성(예: 가치 함수 차이의 단조성)을 유지함으로써 모든 반복에서 임계값 정책이 유효하게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.