Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Control in Metric Space with Optimal Regret

Lin F. Yang, Chengzhuo Ni|arXiv (Cornell University)|2019. 05. 05.
Advanced Bandit Algorithms Research참고 문헌 21인용 수 14
한 줄 요약

이 논문은 임의의 상태 및 행동 공간에 거리 척도가 부여된 유한 수명 주기 결정론적 제어 시스템을 위한 간단한 상한 신뢰 강화학습 알고리즘을 제안한다. 근접 이웃 구축을 통해 기능 근사 오라클을 이용해 낙관적인 Q함수를 추정함으로써, $ O(HL(KH)^{(d-1)/d}) $의 누적 손실을 달성하며, 여기서 $ d $는 상태-행동 공간의 두 배 차원이고, 메트릭 연속성 가정 하에 근사적으로 매칭되는 하한을 확립하여 최적성의 가능성을 입증한다.

ABSTRACT

We study online reinforcement learning for finite-horizon deterministic control systems with {\it arbitrary} state and action spaces. Suppose that the transition dynamics and reward function is unknown, but the state and action space is endowed with a metric that characterizes the proximity between different states and actions. We provide a surprisingly simple upper-confidence reinforcement learning algorithm that uses a function approximation oracle to estimate optimistic Q functions from experiences. We show that the regret of the algorithm after $K$ episodes is $O(HL(KH)^{\frac{d-1}{d}}) $ where $L$ is a smoothness parameter, and $d$ is the doubling dimension of the state-action space with respect to the given metric. We also establish a near-matching regret lower bound. The proposed method can be adapted to work for more structured transition systems, including the finite-state case and the case where value functions are linear combinations of features, where the method also achieve the optimal regret.

연구 동기 및 목표

  • 동역학 또는 보상에 대한 파rametric 가정 없이 일반적인 온라인 강화학습 알고리즘을 개발하는 것.
  • 상태-행동 공간의 메트릭 구조를 활용하여 제한된 경험으로부터 효과적인 일반화를 가능하게 하는 것.
  • 환경의 내재 차원(이중 차원)에 따라 스케일링되는 비선형 누적 손실를 달성하는 것.
  • 메트릭 연속성 가정 하에 엄밀한 누적 손실 상한과 하한을 확립하는 것.
  • 유한 상태 MDP 및 선형 기능 근사와 같은 구조화된 사례에 이 알고리즘을 적응시켜 각각 최적의 누적 손실를 달성하는 것.

제안 방법

  • 알고리즘은 과거 전이를 저장하는 경험 버퍼를 사용하며, 각 에피소드 후에 기능 근사 오라클을 활용해 낙관적인 Q함수를 재계산한다.
  • 오라클은 관측된 데이터에 대해 근접 이웃 추정기를 피팅하여 상한 신뢰 Q함수를 구성함으로써, 미관측 영역에서도 낙관적 성향을 보장한다.
  • 이 방법은 상태-행동 공간의 주어진 메트릭에 대해 전이 및 보상 함수가 리프시츠 연속임을 가정한다.
  • 누적 손실 분석은 정보 이론적 접근을 통해 수행되며, 성능을 메트릭 공간의 이중 차원과 연결한다.
  • 선형 모델의 경우, 기능 근사기구는 미관측 특징에 대해 상한을 적용하는 선형 회귀를 사용하도록 조정되어, 유한한 누적 손실를 보장한다.
  • 알고리즘은 낙관적인 Q함수를 기반으로 정책을 동적으로 갱신하여 불확실성이 높은 영역의 탐색을 촉진한다.

실험 결과

연구 질문

  • RQ1파rametric 가정 없이 메트릭 기반 강화학습 알고리즘이 비선형 누적 손실를 달성할 수 있는가?
  • RQ2메트릭 연속성 하에서 상태-행동 공간의 내재 차원(이중 차원)에 따라 누적 손실는 어떻게 스케일링되는가?
  • RQ3제안된 누적 손실 상한이 최적인지 확인되며, 이를 상회하는 하한이 존재하는가?
  • RQ4이 방법은 유한 상태 MDP 및 선형 기능 근사와 같은 구조화된 모델에 적응하여 최적의 성능를 달성할 수 있는가?
  • RQ5기능 근사 오라클은 메트릭 공간에서 낙관성과 일반화를 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 알고리즘은 $ O(HL(KH)^{(d-1)/d}) $의 누적 손실 상한을 달성하며, 여기서 $ d $는 상태-행동 공간의 이중 차원, $ L $은 부드러움 파라미터, $ H $는 수명 주기이다.
  • 근사적으로 매칭되는 누적 손실 하한 $ ilde{ heta}( ext{min}(| ext{커버링 세트}|, K) imes H ) $가 확립되어 상한이 로그 인자 외에는 최적임을 입증한다.
  • 유한 상태-행동의 경우, 누적 손실는 $ O(SAH) $로 감소하며, 기존의 알려진 결과와 일치하여 이 방법이 표본 기반 강화학습의 일반화임을 검증한다.
  • d차원 특징을 가진 선형 MDP의 경우, 누적 손실는 $ O(Hd) $이며, 이는 최신 기술 수준과 일치하며 최적임을 입증한다.
  • 기능 근사기구가 선형 모델이나 다른 구조적 클래스로 대체되더라도 방법은 여전히 효과적이며 최적의 누적 손실 스케일링을 유지한다.
  • 근접 이웃 기반 낙관적 기능 근사를 사용함으로써 연속적인 메트릭 공간에서 효과적인 일반화와 탐색이 가능해진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.