Skip to main content
QUICK REVIEW

[논문 리뷰] Nonstationary Reinforcement Learning with Linear Function Approximation

Huozhi Zhou, Jing‐Lin Chen|arXiv (Cornell University)|2020. 10. 08.
Reinforcement Learning in Robotics참고 문헌 53인용 수 13
한 줄 요약

이 논문은 보상과 전이 함수가 시간에 따라 변화하는 에피소딕 MDP에서 선형 함수 근사와 함께 비정적 강화 학습을 위한 LSVI-UCB-Restart 및 Ada-LSVI-UCB-Restart 알고리즘을 제안한다. 환경의 총 변화량이 유한할 조건 하에서 하위선형 동적 복귀 경계를 확립하고, 최소최대 복귀 하한선을 증명하며, 이론과 실험을 통해 거의 최적임을 보여준다.

ABSTRACT

We consider reinforcement learning (RL) in episodic Markov decision processes (MDPs) with linear function approximation under drifting environment. Specifically, both the reward and state transition functions can evolve over time but their total variations do not exceed a $ extit{variation budget}$. We first develop $ exttt{LSVI-UCB-Restart}$ algorithm, an optimistic modification of least-squares value iteration with periodic restart, and bound its dynamic regret when variation budgets are known. Then we propose a parameter-free algorithm $ exttt{Ada-LSVI-UCB-Restart}$ that extends to unknown variation budgets. We also derive the first minimax dynamic regret lower bound for nonstationary linear MDPs and as a byproduct establish a minimax regret lower bound for linear MDPs unsolved by Jin et al. (2020). Finally, we provide numerical experiments to demonstrate the effectiveness of our proposed algorithms.

연구 동기 및 목표

  • 시간에 따라 변화하는 보상 및 전이 함수를 가진 비정적 환경에서 통계적으로 효율적인 강화 학습 알고리즘 설계의 과제를 해결한다.
  • 사용자 선호도와 동역학이 변화하는 실세계 응용 분야(예: 온라인 광고 및 자율 시스템)에서 정적 RL 가정의 한계를 극복한다.
  • 환경 동역학의 총 변화량이 유한할 조건 하에서 에피소딕 MDP에서 선형 함수 근사와 함께 하위선형 동적 복귀를 달성하는 알고리즘을 개발한다.
  • 비정적 선형 MDP에 대해 최소최대 동적 복귀 하한선을 포함한 이론적 보장을 제공하며, 제안된 방법의 거의 최적성을 입증한다.
  • 모르는 환경 이격 정도에 적응할 수 있는 파라미터 없는 알고리즘(Ada-LSVI-UCB-Restart)을 설계한다.

제안 방법

  • 시간에 따라 변화하는 환경에 적응하기 위해 주기적인 정책 재시작을 통합한 최적화된 최소 제곱가치 반복(LSVI)의 변형인 LSVI-UCB-Restart를 제안한다.
  • 비정적 환경 하에서 탐색과 이용의 균형을 확보하기 위해 가치 함수 추정치에 상한 신뢰도(Upper Confidence Bound, UCB)를 적용한다.
  • 환경의 총 이격 정도를 측정하기 위해 변화 예산 제약 조건을 도입하여 복귀 분석을 가능하게 한다.
  • 변화 예산을 사전에 알지 못하더라도 재시작 간격을 적응적으로 조정할 수 있는 파라미터 없는 확장인 Ada-LSVI-UCB-Restart를 도입한다.
  • 진짜 가치 함수가 알려진 특징 매핑에 대해 선형인 선형 MDP의 구조를 활용하여 효율적인 함수 근사를 가능하게 한다.
  • 행렬 농도 불등식과 자기정규화 마팅게일 경계를 적용하여 시간에 따라 변화하는 동역학 하에서 추정 오차를 통제한다.

실험 결과

연구 질문

  • RQ1선형 함수 근사와 함께 비정적 MDP에서 하위선형 동적 복귀를 달성하는 통계적으로 효율적인 강화 학습 알고리즘을 설계할 수 있는가?
  • RQ2총 변화량이 유한한 비정적 선형 MDP에서 동적 복귀의 본질적 한계(최소최대 복귀 하한선)는 무엇인가?
  • RQ3비정적 RL에서 알려지지 않은 수준의 환경 이격 정도에 적응할 수 있는 파라미터 없는 알고리즘을 어떻게 설계할 수 있는가?
  • RQ4주기적인 재시작을 통한 최적화 기반 접근법이 선형 MDP에서 시간에 따라 변화하는 보상 및 전이 함수를 효과적으로 다룰 수 있는가?
  • RQ5함수 근사와 함께 비정적 RL 환경에서 동적 복귀에 대해 로그 인자 수준까지 날카로운 이론적 보장을 확립할 수 있는가?

주요 결과

  • 총 변화 예산 $ B $ 가 알려져 있을 경우 제안된 LSVI-UCB-Restart 알고리즘이 $ O(B^{1/3} d^{2/3} H^{1/3} T^{2/3}) $ 의 동적 복귀 경계를 달성한다.
  • 변화 예산 $ B $ 를 사전에 알지 못하더라도 Ada-LSVI-UCB-Restart 알고리즘이 $ O(B^{1/3} d^{2/3} H^{1/3} T^{2/3} \text{polylog}(T)) $ 의 약간 떨어진 동적 복귀 경계를 확보하며, 알려지지 않은 이격 정도에 적응함을 보여준다.
  • 비정적 선형 MDP에 대해 최소최대 동적 복귀 하한선 $ \Omega(B^{1/3} d^{2/3} H^{1/3} T^{2/3}) $ 를 확립하여 제안된 알고리즘이 로그 인자 수준까지 거의 최적임을 입증한다.
  • 이론적 분석을 통해 선형 MDP에 대해 최소최대 복귀 하한선을 처음으로 확립하며, 이는 이전 연구 [1] 가 해결하지 못한 열린 문제를 해결한다.
  • 15개 상태, 7개 행동, 10단계 환경, 10차원 특징을 가진 합성 비정적 선형 MDP에서의 수치 실험 결과, 급격한 변화와 점진적 변화 상황 모두에서 제안된 알고리즘이 효과적임을 확인하였다.
  • 결과는 두 알고리즘이 변화하는 환경에 효과적으로 적응하며, 특히 변화 예산을 모를 경우에도 Ada-LSVI-UCB-Restart가 뛰어난 성능 유지를 보임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.