[논문 리뷰] $\sqrt{n}$-Regret for Learning in Markov Decision Processes with Function Approximation and Low Bellman Rank
이 논문은 함수 근사와 낮은 벨만 랭크를 갖는 마르코프 결정 과정(MDP)을 위한 온라인 강화학습 알고리즘인 AVE(Adaptive Value-function Elimination)를 제안한다. 정책 제거를 문맥적 밴딧 문제로 재구성하고, 능동적 제거와 전문가 가중치 기법을 활용하여 AVE는 √n-레그레트를 달성한다. 이는 일반 함수 근사가 가능한 스토케스틱 MDP에서 처음으로 이룬 결과로, 이전 방법들에 비해 레그레트 경계를 크게 향상시킨다.
In this paper, we consider the problem of online learning of Markov decision processes (MDPs) with very large state spaces. Under the assumptions of realizable function approximation and low Bellman ranks, we develop an online learning algorithm that learns the optimal value function while at the same time achieving very low cumulative regret during the learning process. Our learning algorithm, Adaptive Value-function Elimination (AVE), is inspired by the policy elimination algorithm proposed in (Jiang et al., 2017), known as OLIVE. One of our key technical contributions in AVE is to formulate the elimination steps in OLIVE as contextual bandit problems. This technique enables us to apply the active elimination and expert weighting methods from (Dudik et al., 2011), instead of the random action exploration scheme used in the original OLIVE algorithm, for more efficient exploration and better control of the regret incurred in each policy elimination step. To the best of our knowledge, this is the first $\sqrt{n}$-regret result for reinforcement learning in stochastic MDPs with general value function approximation.
연구 동기 및 목표
- 크기 있는 상태공간을 갖는 MDP에서 함수 근사가 가능한 강화학습 알고리즘을 개발하여 낮은 레그레트를 달성하는 것.
- 모르는 전이 및 보상 함수를 갖는 MDP에서 효율적인 탐색의 과제를 해결하는 것.
- 기존의 정책 제거 기법을 일반 함수 클래스에서 √n-레그레트를 달성하도록 확장하는 것.
- OLIVE와 비교해 행동공간 크기 A에 대한 레그레트 의존도를 향상시키기 위해 베르누이 스타일의 균일 농도 경계를 사용하는 것.
- 가짜 차원과 나타라잔 차원을 사용하여 무한 가설 공간으로의 알고리즘 일반화를 시도하는 것.
제안 방법
- OLIVE의 정책 제거 단계를 문맥적 밴딧 문제로 재구성하여 능동적 탐색을 가능하게 한다.
- 문맥적 밴딧에서 유래한 능동적 제거와 전문가 가중치 기법을 적용하여 각 제거 단계에서의 레그레트를 감소시킨다.
- 추정 오차를 제어하고 A에 대한 의존도를 향상시키기 위해 베르누이 스타일의 균일 농도 정리(보조정리 F.3)를 사용한다.
- 이전 연구에서 유래한 부피 기반 추론을 함수 근사와 낮은 벨만 랭크에 맞게 적응시킨다.
- 개선된 파rameter 스케줄링과 가치 함수 클래스에 대한 이진 탐색을 도입하여 탐색과 이용의 균형을 맞춘다.
- 유한 함수 클래스에 대한 균일 수렴을 무한 가설 공간의 경우에 적합한 가짜 차원과 나타라잔 차원 기반의 경계로 대체한다.
실험 결과
연구 질문
- RQ1일반 함수 근사와 알려지지 않은 동역학을 갖는 스토케스틱 MDP에서 √n-레그레트를 달성할 수 있는가?
- RQ2기존 알고리즘인 OLIVE와 비교해 행동공간 크기 A에 대한 레그레트 의존도를 어떻게 향상시킬 수 있는가?
- RQ3통계적 복잡도 측정치를 사용하여 정책 제거 프레임워크를 무한 가설 공간으로 확장할 수 있는가?
- RQ4문맥적 밴딧 기법은 MDP 학습 과정 내에서 효율적 탐색을 가능하게 하는 데 어떤 역할을 하는가?
- RQ5베르누이 스타일의 농도 경계는 함수 근사 설정에서 레그레트 경계를 향상시키고 A에 대한 의존도를 감소시킬 수 있는가?
주요 결과
- 알고리즘이 높은 확률로 √n-레그레트를 달성하며, 이는 일반 함수 근사가 가능한 스토케스틱 MDP에서 처음으로 이룬 결과이다.
- 레그레트 경계는 Õ(√(M²AH⁴(d_Π + d_𝒱)n))으로 표현되며, 여기서 d_Π와 d_𝒱는 정책 및 가치 함수 클래스의 나타라잔 차원과 가짜 차원이다.
- 보조정리 F.3의 적용 덕분에 레그레트 경계에서 행동공간 크기 A에 대한 의존도가 A²에서 A로 개선되었다.
- 가짜 차원과 나타라잔 차원을 사용하여 |ℱ| 대신 이들을 활용함으로써 무한 가설 공간으로의 일반화가 가능해졌다.
- ϵ-최적성을 달성하기 위한 샘플 복잡도는 Õ(M²AH⁴(d_Π + d_𝒱)/ϵ²)로, OLIVE의 Õ(M²A²H³(d_Π + d_𝒱)/ϵ²)보다 향상되었다.
- 제거 과정이 문맥적 밴딧 문제로 재해석되어 능동적 탐색과 더 엄격한 레그레트 제어가 가능해졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.