[논문 리뷰] Optimal Regret Bounds for Selecting the State Representation in Reinforcement Learning
이 논문은 유한한 후보 모델 집합에서 마코프 결정 과정(MDP)을 제공하는 모델이 일부일지라도 최적의 상태 표현을 선택할 수 있는 강화학습 알고리즘인 OMS(Optimistic Model Selection)을 제안한다. 불확실성에 대한 낙관주의를 활용함으로써 OMS는 $O(\sqrt{|Φ|T})$의 리그레트 바운드를 달성하며, 이는 $T$에 대해 최적이며 이전 연구에서 발견된 지수적 추가 항목을 피하고, 단일 MDP에서 학습하는 데 있어서 가장 잘 알려진 리그레트와 일치한다.
We consider an agent interacting with an environment in a single stream of actions, observations, and rewards, with no reset. This process is not assumed to be a Markov Decision Process (MDP). Rather, the agent has several representations (mapping histories of past interactions to a discrete state space) of the environment with unknown dynamics, only some of which result in an MDP. The goal is to minimize the average regret criterion against an agent who knows an MDP representation giving the highest optimal reward, and acts optimally in it. Recent regret bounds for this setting are of order $O(T^{2/3})$ with an additive term constant yet exponential in some characteristics of the optimal MDP. We propose an algorithm whose regret after $T$ time steps is $O(\sqrt{T})$, with all constants reasonably small. This is optimal in $T$ since $O(\sqrt{T})$ is the optimal regret in the setting of learning in a (single discrete) MDP.
연구 동기 및 목표
- 유한한 후보 모델 집합에서 마코프 동역학을 제공하는 모델이 일부일지라도 최적의 상태 표현을 선택할 수 있는 학습 알고리즘을 개발하는 것.
- 정확한 모델이 사전에 알려지지 않았을 경우에도 단일 MDP에서 학습하는 데 알려진 최적의 $O(\sqrt{T})$ 리그레트 바운드를 달성하는 것.
- 이전 방법들에서 나타나는, 최적 모델의 MDP 직경에 의존하는 지수적 추가 항목을 포함하지 않는 리그레트 바운드를 확보하는 것.
- 이론적으로 타당하고 실용적인 알고리즘을 제공함으로써, MDP 성질에 대한 비용이 많이 드는 가설 검증 대신 모델 간의 낙관적 탐색을 사용하는 것.
제안 방법
- OMS는 현재 추정치를 바탕으로 가장 높은 잠재 보상 가능성을 보이는 모델을 선호하는 낙관적 모델 선택 원칙을 사용한다.
- 알고리즘은 각 모델에 대한 기대 보상에 대한 신뢰구간을 유지하고, 각 단계에서 가장 높은 상한 신뢰구간을 가진 모델을 선택한다.
- 선택된 모델 내부에서 UCRL2 알고리즘의 변종을 사용하여 정책을 학습하고 전이 및 보상 동역학을 추정한다.
- 누적 보상에 대한 통계적 검정을 통해 비마코프 모델을 동적으로 제거함으로써, 높은 잠재력을 지닌 모델들만 유지되도록 보장한다.
- 상태-행동 쌍에 대한 방문 횟수를 두 배로 늘리거나 보상 일관성 검증에 실패할 경우를 기준으로 한 에피소드 기반 학습을 사용한다.
- 리그레트 분석은 에피소드 수와 신뢰구간 성장에 대한 바운드를 결합하며, 농도 불등식과 에피소드 수에 대한 로그 바운드를 활용한다.
실험 결과
연구 질문
- RQ1마코프 동역학을 제공하는 모델이 일부일지라도, 유한한 모델 집합에서 최적의 상태 표현을 선택하는 데 $O(\sqrt{T})$ 리그레트를 달성할 수 있는가?
- RQ2최적 모델의 MDP 직경에 의존하는 지수적 추가 항목을 포함하지 않는 리그레트 바운드를 얻는 것이 가능한가?
- RQ3이론적 보장을 유지하면서도, 균일 탐색보다 리그레트 측면에서 낙관주의 기반 모델 선택이 우월한가?
- RQ4이러한 설정에서 후보 모델 수 $|\Phi|$에 대한 최적의 의존성은 무엇인가?
- RQ5이 알고리즘은 마코프 동역학에 대한 거리 개념을 갖는 무한 또는 연속적인 모델 가족으로 확장될 수 있는가?
주요 결과
- OMS는 모든 상수들이 합리적으로 작은 $O(\sqrt{|Φ|T})$ 리그레트 바운드를 달성하며, 이는 $T$에 대해 최적이며 단일 MDP에서 학습하는 데 있어서 가장 잘 알려진 리그레트와 일치한다.
- 이 리그레트 바운드는 BLB와 같은 이전 방법들과 달리 최적 모델의 MDP 직경에 대한 지수적 추가 항목을 포함하지 않는다.
- 높은 확률($1 - \delta$)로 최적의 마코프 모델이 학습 도중 제거되지 않으며, 비마코프 모델은 보상 일관성 기반으로 제거된다.
- 에피소드 수 $K_T$ 는 $O(SA \log T + |\Phi|)$로 바운드되며, 이는 리그레트 바운드 내에서 전체적인 로그 의존성에 기여한다.
- 분석 결과 리그레트는 $\sqrt{|Φ|T}$ 비례로 증가하며, 이 $|\Phi|$에 대한 의존성은 추측으로서 최적이지만 아직 증명되지 않았다.
- OMS는 $T$에 대한 리그레트 의존성 측면에서 BLB를 능가하며, $\sqrt{T}$에 비해 열등한 $T^{2/3}$ 스케일링을 피한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.