[논문 리뷰] Learning Infinite-horizon Average-reward MDPs with Linear Function Approximation
이 논문은 선형 함수 근사와 함께 무한 시간할인 평균 보상 마르코프 결정 과정을 학습하기 위한 세 가지 새로운 알고리즘을 제안한다. $;(ackslash sqrt"){T}$ 및 $ackslashackslash widetildeackslash mathcalackslash O(T^{3/4})$의 오차를 각각 가지는 FOPO와 OLSVI.FH를 선형 MDP에 적용하고, 적대적 밴디트에 영감을 받은 MDP-Exp2는 다른 가정 하에 $ackslashackslash widetildeackslash mathcalackslash O(ackslash sqrt"){T}$의 오차를 달성하며, 이는 이전 결과를 향상시키고 자연 정책 기울기 방법과 연결한다.
We develop several new algorithms for learning Markov Decision Processes in an infinite-horizon average-reward setting with linear function approximation. Using the optimism principle and assuming that the MDP has a linear structure, we first propose a computationally inefficient algorithm with optimal $\\widetilde{O}(\\sqrt{T})$ regret and another computationally efficient variant with $\\widetilde{O}(T^{3/4})$ regret, where $T$ is the number of interactions. Next, taking inspiration from adversarial linear bandits, we develop yet another efficient algorithm with $\\widetilde{O}(\\sqrt{T})$ regret under a different set of assumptions, improving the best existing result by Hao et al. (2020) with $\\widetilde{O}(T^{2/3})$ regret. Moreover, we draw a connection between this algorithm and the Natural Policy Gradient algorithm proposed by Kakade (2002), and show that our analysis improves the sample complexity bound recently given by Agarwal et al. (2020).
연구 동기 및 목표
- 무한 시간할인 평균 보상 MDP에 대한 강화 학습 이론적 갭을 메우기 위해.
- 선형 MDP 가정 하에 최적의 오차 경계를 가진 계산적으로 효율적인 알고리즘을 개발하기 위해.
- 기존의 오차 경계를 향상시키고, 특히 이전 연구와 다른 또는 더 약한 가정 하에서 평균 보상 설정에서의 성능을 향상시키기 위해.
- 제안된 MDP-Exp2 알고리즘과 자연 정책 기울기 방법 사이의 연결 고리를 설정하여 표본 복잡도 이해를 향상시키기 위해.
제안 방법
- 비볼록 제약 조건을 갖는 옵timistic 고정점 최적화 알고리즘인 FOPO를 제안하며, LSVI에 유사한 형태의 옵티미즘 텀을 포함하고, 오차 제어를 위해 레이지 업데이트 스케줄을 사용한다.
- 무한 시간할인 문제를 유한 시간할인 문제로 재구성하여 옵티미즘 LSVI를 적용하는 OLSVI.FH를 도입함으로써 효율적인 계산을 가능하게 하지만 오차는 더 높아진다.
- 적대적 선형 밴디트(Exp2)에 영감을 받은 MDP-Exp2를 개발하며, 각 상태에서 지수 가중치 업데이트를 수행하고, 중요도 가중치와 궤적 집계를 통해 거의 편향이 없는 보상 추정기를 구성한다.
- 장점 함수 $A^{\pi_\theta}(x,a)$의 거의 편향 없는 추정기를 $\mathcal{O}(1/\sigma)$개의 궤적을 통해 구성하며, 분산은 $\mathcal{O}(1/\sigma)$로 제한되어 있어 낮은 편향과 관리 가능한 분산을 확보한다.
- 동일한 가정 하에 MDP-Exp2의 업데이트 방향이 자연 정책 기울기(NPG) 알고리즘의 정책 업데이트 단계와 일치함을 보여줌으로써 두 알고리즘 간의 연결 고리를 설정한다.
- 궤적 집계를 위해 $M_k^{-1}$를 통한 중요도 가중치를 활용하여 장점 추정기의 편향을 줄이고 안정적이고 효율적인 학습을 가능하게 한다.
실험 결과
연구 질문
- RQ1무한 시간할인 평균 보상 MDP에 대해 선형 함수 근사 하에 near-optimal $\widetilde{\mathcal{O}}(\sqrt{T})$ 오차를 가지는 계산적으로 효율적인 알고리즘을 설계할 수 있는가?
- RQ2강력한 가정(예: 균일한 혼합성)에 의존하지 않고 선형 MDP 가정 하에 평균 보상 설정에서 낮은 오차를 달성할 수 있는가?
- RQ3Hao 등(2021)의 $\widetilde{\mathcal{O}}(T^{2/3})$ 오차 경계를 동일한 가정 조건 하에서 향상시킬 수 있는가?
- RQ4제안된 MDP-Exp2 알고리즘과 자연 정책 기울기 방법 사이의 관계는 무엇이며, 표본 복잡도에 어떤 영향을 미치는가?
주요 결과
- FOPO는 벨만 최적성 방정식 가정 하에 높은 확률로 $\widetilde{\mathcal{O}}(\sqrt{dT})$의 오차를 달성하며, 이는 최적의 $T$-의존성과 일치한다.
- OLSVI.FH는 무한 시간할인 문제를 유한 시간할인 문제로 환원함으로써 효율적인 계산을 가능하게 하며, $\widetilde{\mathcal{O}}((dT)^{3/4})$의 오차를 달성한다.
- MDP-Exp2는 균일한 혼합성과 균일하게 자극된 특징을 가정할 경우 $\widetilde{\mathcal{O}}(\sqrt{T})$의 오차를 달성하며, Hao 등(2021)의 $\widetilde{\mathcal{O}}(T^{2/3})$ 경계를 초월한다.
- MDP-Exp2의 분석은 Agarwal 등(2020)의 표본 복잡도 경계를 향상시켜, 그들의 방법이 $\mathcal{O}(T^{3/4})$의 오차를 낼 때에 비해 $\widetilde{\mathcal{O}}(\sqrt{T})$의 오차를 달성한다.
- MDP-Exp2 알고리즘의 추정기 구성은 각 업데이트당 $\mathcal{O}(1/\sigma)$개의 궤적만으로도 근본적인 편향과 제한된 분산을 확보하여 효율적이고 안정적인 학습을 가능하게 한다.
- 논문은 MDP-Exp2와 자연 정책 기울기 알고리즘 간의 공식적인 연결 고리를 설정하며, 동일한 가정 하에 업데이트 방향이 NPG의 정책 향상 단계와 일치함을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.