[논문 리뷰] Near-optimal Representation Learning for Linear Bandits and Linear RL
이 논문은 다중 작업 선형 밴디트와 선형 함수 근사가 적용된 순환 강화학습을 위한 샘플 효율적인 알고리즘인 MTLR-OFUL을 제안한다. 이 알고리즘은 작업 간에 공유되는 저차원 표현을 활용한다. 선형 밴디트에서는 $ ilde{O}(Mackslash sqrt{dkT} + dackslash sqrt{kMT})$의 거의 최적의 누적 손실 한계를 달성하고, 강화학습에서는 $ ilde{O}(HMackslash sqrt{dkT} + Hdackslash sqrt{kMT} + HMTackslash sqrt{d}ackslash mathcal{I})$를 달성한다. 이는 독립 학습 기반선보다 크게 향상되었으며, 날카로운 하한선을 증명함으로써 제안된 알고리즘의 최적성 또한 입증한다.
This paper studies representation learning for multi-task linear bandits and multi-task episodic RL with linear value function approximation. We first consider the setting where we play $M$ linear bandits with dimension $d$ concurrently, and these bandits share a common $k$-dimensional linear representation so that $k\ll d$ and $k \ll M$. We propose a sample-efficient algorithm, MTLR-OFUL, which leverages the shared representation to achieve $ ilde{O}(M\sqrt{dkT} + d\sqrt{kMT} )$ regret, with $T$ being the number of total steps. Our regret significantly improves upon the baseline $ ilde{O}(Md\sqrt{T})$ achieved by solving each task independently. We further develop a lower bound that shows our regret is near-optimal when $d > M$. Furthermore, we extend the algorithm and analysis to multi-task episodic RL with linear value function approximation under low inherent Bellman error \citep{zanette2020learning}. To the best of our knowledge, this is the first theoretical result that characterizes the benefits of multi-task representation learning for exploration in RL with function approximation.
연구 동기 및 목표
- M개의 작업 간에 공유되는 저차원 표현을 가진 다중 작업 선형 밴디트를 위한 샘플 효율적인 알고리즘을 개발하는 것.
- 선형 가치 함수 근사와 낮은 본질적 벨만 오차를 가진 다중 작업 순환 강화학습으로 알고리즘을 확장하는 것.
- 함수 근사와 함께 순차적 결정 문제에서 탐색을 위한 표현 학습의 이점을 이론적으로 입증하는 것.
- 근사 최적의 누적 손실 한계와 하한선을 증명하여 제안된 알고리즘이 최적임을 입증하는 것.
제안 방법
- 공유되는 저차원 표현과 작업별 파라미터를 함께 최적화하는 다중 작업 선형 밴디트 알고리즘인 MTLR-OFUL을 제안하며, 정규화된 최소 제곱 추정기를 사용한다.
- OFUL와 유사한 신뢰 타원체 접근법을 사용하지만, 공유 표현 학습에 적응시켰으며, 작업 간에 저랭크 구조를 장려하는 새로운 정규화를 도입한다.
- 공유되는 $k$차원 표현을 활용하고 표현 인식 정규화를 적용하는 LSVI 스타일 업데이트를 사용하는 다중 작업 순환 강화학습의 새로운 알고리즘 프레임워크를 제안한다.
- 추정 오차와 표현 오차의 새로운 분해를 통해 누적 손실 한계를 유도하며, 공유 부분공간의 구조를 정교하게 다룬다.
- 단일 작업 설정으로의 감소를 통한 어려운 인스턴스 생성을 통해 하한선을 확립하며, 누적 손실 한계의 날카로움을 입증한다.
- 근사 오차 $\zeta$ 에 따라 누적 손실을 유계로 제한함으로써 모델 잘못 지정에 대한 강건성 분석을 수행한다.
실험 결과
연구 질문
- RQ1공유되는 저차원 표현을 가진 작업들이 존재할 때, 다중 작업 표현 학습이 선형 밴디트에서 누적 손실을 크게 감소시킬 수 있는가?
- RQ2공유되는 $k$차원 표현이 존재하는 다중 작업 선형 밴디트에서의 누적 손실의 기본 한계는 무엇이며, 제안된 알고리즘이 거의 최적인가?
- RQ3공유 표현 학습의 이점은 선형 함수 근사를 가진 다중 작업 순환 강화학습으로까지 확장될 수 있는가?
- RQ4본질적 벨만 오차 $\mathcal{I}$ 는 공유 표현을 가진 다중 작업 강화학습의 샘플 효율성에 어떤 영향을 미치는가?
- RQ5제안된 알고리즘은 모델 잘못 지정에 강건한가? 그리고 근사 오차 $\zeta$ 는 누적 손실에 어떤 영향을 미치는가?
주요 결과
- 제안된 MTLR-OFUL 알고리즘은 다중 작업 선형 밴디트에서 $ ilde{O}(M\backslash sqrt{dkT} + d\backslash sqrt{kMT})$ 의 누적 손실 한계를 달성하며, 독립 학습 기반선인 $ ilde{O}(Md\backslash sqrt{T})$ 보다 향상된다.
- d > M 인 경우, $ ilde{O}(Mk\backslash sqrt{HT} + d\backslash sqrt{HkMT})$ 의 일치하는 하한선을 통해 이 누적 손실 한계가 거의 최적임을 입증한다.
- 선형 가치 함수 근사를 가진 다중 작업 순환 강화학습에서는 알고리즘이 $ ilde{O}(HM\backslash sqrt{dkT} + Hd\backslash sqrt{kMT} + HMT\backslash sqrt{d}\backslash mathcal{I})$ 의 누적 손실을 달성하며, 독립 학습 기반선인 ELEANOR보다 크게 향상된다.
- 진짜 파라미터가 $k$차원 부분공간으로부터 $ackslash zeta$ 이내에 있을 경우, 알고리즘은 $ ilde{O}(M\backslash sqrt{dkT} + d\backslash sqrt{kMT} + MT\backslash sqrt{d}\backslash zeta)$ 의 누적 손실을 달성하며 모델 잘못 지정에 강건하다.
- 이 논문은 다중 작업 선형 강화학습에서 탐색을 위한 첫 번째 증명 가능한 샘플 효율적인 알고리즘을 확립하며, 정보 이론적 하한선과 일치하는 날카로운 누적 손실 한계를 제공한다.
- 이론적 분석은 공유 표현 학습이 함수 근사를 가진 선형 밴디트와 순환 강화학습 모두에서 상당한 데이터 효율성 향상을 가능하게 한다는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.