Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal Regularization in Markov Decision Process

Pierre Thodoroff, Audrey Durand|arXiv (Cornell University)|2018. 11. 01.
Reinforcement Learning in Robotics인용 수 7
한 줄 요약

이 논문은 시간에 따른 평가치의 연속성(스무쓰니스)을 활용하여 변동성을 줄이고 강화학습의 안정성을 향상시키기 위해 마르코프 결정 과정(MDP)에 시간적 정규화를 도입한다. 과거 상태의 가치를 감쇠된 가중 평균으로 통합함으로써, 노이즈가 많거나 잘못 지정된 상태 표현에 대해서도 강건한 성능을 보이며, 딥 함수 근사와 함께 사용할 경우 아케이드 게임에서 향상된 성능을 보인다.

ABSTRACT

Several applications of Reinforcement Learning suffer from instability due to high variance. This is especially prevalent in high dimensional domains. Regularization is a commonly used technique in machine learning to reduce variance, at the cost of introducing some bias. Most existing regularization techniques focus on spatial (perceptual) regularization. Yet in reinforcement learning, due to the nature of the Bellman equation, there is an opportunity to also exploit temporal regularization based on smoothness in value estimates over trajectories. This paper explores a class of methods for temporal regularization. We formally characterize the bias induced by this technique using Markov chain concepts. We illustrate the various characteristics of temporal regularization via a sequence of simple discrete and continuous MDPs, and show that the technique provides improvement even in high-dimensional Atari games.

연구 동기 및 목표

  • 고차원적이고 노이즈가 많은 환경에서 강화학습의 높은 변동성을 해결하기 위해.
  • 공간 정규화와 보완적으로 시간 정규화를 가치 함수 추정에 적용하는 방법을 탐색하기 위해.
  • 마르코프 체인 이론을 사용하여 시간 정규화가 유도하는 편향을 공식적으로 특성화하기 위해.
  • 시간 정규화가 잘못 지정되거나 노이즈가 많은 상태 특징에 대해 얼마나 강건한지 평가하기 위해.
  • 이를 바탕으로 이산 및 연속 MDP, 아케이드 환경을 포함한 다양한 환경에서 시간 정규화의 효과성을 입증하기 위해.

제안 방법

  • 지수 감쇠를 사용하여 현재 가치와 과거 상태 가치의 가중 평균을 조합하는 시간 정규화 가치 함수 추정을 제안한다.
  • 정규화된 가치를 $ v_{\text{reg}}(s_t) = v(s_t) + \lambda \widetilde{v}(s_{t-1}) $ 로 정의하며, 여기서 $ \widetilde{v}(s_{t-1}) $ 는 이전 가치 추정치의 지수 감쇠 합이다.
  • 세부 균형 조건과 역행 체인 개념을 활용하여 정규화된 추정치의 편향 및 수렴 성질을 분석한다.
  • 정책 평가 및 제어 설정 모두에 적용하며, 프레임 스택 상태 표현을 사용한 PPO를 통해 딥 강화학습에 확장한다.
  • 특히 딥 러닝 실험에서 편향을 줄이기 위해 정규화 강도 $ \beta $ 에 대한 감쇠 스케줄을 도입한다.
  • 정규화된 성능 지표(식 12)를 사용하여 이산 MDP, 연속 MDP, 아케이드 학습 환경에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1시간에 따른 평가치의 스무쓰니스를 강제함으로써 시간 정규화가 가치 함수 추정의 변동성을 줄일 수 있는가?
  • RQ2시간 정규화는 MDP에서 편향과 수렴에 어떤 영향을 미치며, 마르코프 체인 이론을 통해 이를 공식적으로 특성화할 수 있는가?
  • RQ3노이즈가 많거나 잘못 지정된 상태 표현이 존재하는 환경에서 시간 정규화는 표본 효율성과 강건성을 향상시키는가?
  • RQ4시간 정규화는 공간 정규화 및 다단계 방법과 비교하여 성능와 안정성 면에서 어떻게 다른가?
  • RQ5시간 정규화는 프레임 스택 상태 표현을 사용하는 아케이드 게임과 같은 딥 강화학습 환경에서 학습 성능을 향상시킬 수 있는가?

주요 결과

  • 식 (12)에 제시된 정규화된 성능 지표로 측정한 결과, 시간 정규화는 여러 아케이드 게임에서 성능을 크게 향상시키며, 더 나은 표본 효율성과 안정성을 나타낸다.
  • 딥 네트워크를 사용한 함수 근사에서도 이산 및 연속 MDP 모두에서 추정 오차와 변동성을 감소시킨다.
  • 노이즈가 많거나 잘못 지정된 상태 특징에 대해서도 시간 정규화는 강건성을 제공하며, 상태 표현이 불완전한 환경에서 베이시스라인 방법보다 뛰어난 성능을 보인다.
  • 10개의 랜덤 시드와 7개의 게임에서 일관된 성능 향상이 관찰되었으며, 하이퍼파ram터 $ \beta = \lambda = 0.2 $ 와 감쇠율 $ 1\times10^{-5} $ 는 검증을 통해 선정되었다.
  • 정규화는 최적 가치 함수의 스무쓰니스를 향상시켜 고차원 환경에서 빠른 수렴과 더 나은 일반화 성능을 설명할 수 있다.
  • 시간이 지남에 따라 정규화 강도를 감쇠시키는 전략은 유도된 편향을 완화시키며, 장기 학습에 실용적인 전략임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.