[논문 리뷰] Provably Efficient Reinforcement Learning with Linear Function Approximation Under Adaptivity Constraints
이 논문은 적응성 제약 조건 하에서 선형 마르코프 결정 과정에 대해 두 가지 증명 가능하게 효율적인 강화 학습 알고리즘—LSVI-UCB-Batch와 LSVI-UCB-RareSwitch—을 제안한다. 선형 함수 근사와 배치 업데이트 또는 희귀한 정책 전환 최적화를 활용하여, 완전히 적응 가능한 LSVI-UCB 알고리즘과 동일한 리그레트를 달성하면서도 정책 업데이트 횟수를 크게 줄였다. 배치 설정에서 최적임이 입증된 날카운 감소 리그레트 경계를 확보하였다.
We study reinforcement learning (RL) with linear function approximation under the adaptivity constraint. We consider two popular limited adaptivity models: the batch learning model and the rare policy switch model, and propose two efficient online RL algorithms for episodic linear Markov decision processes, where the transition probability and the reward function can be represented as a linear function of some known feature mapping. In specific, for the batch learning model, our proposed LSVI-UCB-Batch algorithm achieves an $ ilde O(\sqrt{d^3H^3T} + dHT/B)$ regret, where $d$ is the dimension of the feature mapping, $H$ is the episode length, $T$ is the number of interactions and $B$ is the number of batches. Our result suggests that it suffices to use only $\sqrt{T/dH}$ batches to obtain $ ilde O(\sqrt{d^3H^3T})$ regret. For the rare policy switch model, our proposed LSVI-UCB-RareSwitch algorithm enjoys an $ ilde O(\sqrt{d^3H^3T[1+T/(dH)]^{dH/B}})$ regret, which implies that $dH\log T$ policy switches suffice to obtain the $ ilde O(\sqrt{d^3H^3T})$ regret. Our algorithms achieve the same regret as the LSVI-UCB algorithm (Jin et al., 2019), yet with a substantially smaller amount of adaptivity. We also establish a lower bound for the batch learning model, which suggests that the dependency on $B$ in our regret bound is tight.
연구 동기 및 목표
- 정책 업데이트 빈도가 높은 것이 비현실적인 제한된 적응성 조건 하에서 선형 MDP에 대해 효율적인 온라인 강화 학습 알고리즘을 개발하는 것.
- 함수 근사를 사용하여 고차원 및 연속 상태 강화 학습 환경에서 정책 적응 빈도를 줄이는 데 도전하는 것.
- 배치 학습 및 희귀한 정책 전환 모델에 대해 완전히 적응 가능한 알고리즘의 성능을 따라잡는 이론적 리그레트 경계를 수립하는 것.
- 배치 학습 모델에 대한 리그레트 하한을 증명하여, 배치 수에 대한 의존성의 최적성 확인하기
제안 방법
- 정의된 배치의 끝에서만 정책 업데이트를 수행하는 LSVI-UCB-Batch를 제안하며, 상한 신뢰도를 갖춘 선형 값 반복을 사용한다.
- 전체 전환 수에 대한 전역 예산 내에서 정책 전환 시점을 적응적으로 선택하는 LSVI-UCB-RareSwitch를 도입하며, UCB 스타일의 신뢰도 간격을 통해 탐색을 유지한다.
- 차원 d의 알려진 특징 매핑에 대해 전이 및 보상 함수가 선형임을 가정하는 선형 함수 근사 기법을 적용한다.
- 정책 적응 제약 조건 하에서 탐색과 이용의 상호 작용을 분석하고, 농도 불등식 및 낙관적 값 함수 추정을 사용하여 리그레트 경계를 유도한다.
- d차원 특징과 H단계의 에피소드를 갖는 정교하게 설계된 선형 MDP 인스턴스를 사용하여, 배치 학습 모델에 대한 하한을 수립한다.
- 최소 최대 원리와 정보 이론적 도구를 사용하여, 리그레트 경계의 B-의존성은 날카로운 것으로 증명하며, 최적성 확인
실험 결과
연구 질문
- RQ1선형 MDP에서 완전히 적응 가능한 RL 알고리즘과 동일한 리그레트를 달성하면서도 정책 업데이트 횟수를 크게 줄일 수 있는가?
- RQ2선형 함수 근사 RL에서 근사 최적 리그레트를 유지하기 위해 필요한 최소한의 배치 수 또는 정책 전환 수는 얼마인가?
- RQ3리그레트 경계에서 배치 수나 전환 수에 대한 의존성이 최적인지 확인할 수 있으며, 이를 날카로운 것으로 증명할 수 있는가?
- RQ4실제로 배치 처리 및 희귀 전환 알고리즘의 성능은 완전히 적응 가능한 기준 대비 어떻게 되는가?
주요 결과
- LSVI-UCB-Batch는 Õ(√(d³H³T) + dHT/B)의 리그레트를 달성하며, 이는 완전히 적응 가능한 LSVI-UCB 알고리즘의 리그레트를 따라잡기 위해 √(T/dH)개의 배치로 충분함을 보여준다.
- LSVI-UCB-RareSwitch는 Õ(√(d³H³T[1+T/(dH)]^{dH/B}))의 리그레트를 달성하며, 이는 동일한 리그레트를 달성하기 위해 dH log T회의 정책 전환이 충분함을 시사한다.
- LSVI-UCB-Batch의 리그레트 경계는 로그 요소를 제외하고 최적임이 하한 경계를 통해 확인되었다.
- 실험 결과, LSVI-UCB-RareSwitch는 훈련 전반에 걸쳐 완전히 적응 가능한 LSVI-UCB와 유사한 성능를 유지하는 반면, LSVI-UCB-Batch는 많은 에피소드를 거쳐야 비로소 성능에 다다른다.
- 리그레트와 적응성 간의 상충 관계는 실험적으로 검증되었으며, 배치 수나 전환 수가 적을수록 리그레트가 증가하지만, 제안된 알고리즘은 최소한의 적응성으로도 경쟁력 있는 성능를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.