Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Reinforcement Learning for High Dimensional Linear Quadratic Systems

Morteza Ibrahimi, Adel Javanmard|arXiv (Cornell University)|2013. 03. 24.
Advanced Bandit Algorithms Research참고 문헌 13인용 수 17
한 줄 요약

이 논문은 밀도가 낮은 동역학을 가진 고차원 선형정합(LQ) 시스템을 위한 적응형 강화학습 알고리즘을 제안하며, $O(p\sqrt{T})$의 리그레트 한계를 달성한다. 이는 이전의 $O(p^{p+r+2}\sqrt{T})$ 한계에 비해 크게 향상된 결과이다. 시스템 행렬의 희소성과 낙관적 매개변수 추정을 활용하여, $ p $에 대해 다항로그 시간 내에 $ (1+\epsilon) $-최적 평균 비용을 달성함으로써, 온라인 광고와 같은 고차원 환경에서의 효율적 제어를 가능하게 한다.

ABSTRACT

We study the problem of adaptive control of a high dimensional linear quadratic (LQ) system. Previous work established the asymptotic convergence to an optimal controller for various adaptive control schemes. More recently, for the average cost LQ problem, a regret bound of ${O}(\sqrt{T})$ was shown, apart form logarithmic factors. However, this bound scales exponentially with $p$, the dimension of the state space. In this work we consider the case where the matrices describing the dynamic of the LQ system are sparse and their dimensions are large. We present an adaptive control scheme that achieves a regret bound of ${O}(p \sqrt{T})$, apart from logarithmic factors. In particular, our algorithm has an average cost of $(1+\eps)$ times the optimum cost after $T = \polylog(p) O(1/\eps^2)$. This is in comparison to previous work on the dense dynamics where the algorithm requires time that scales exponentially with dimension in order to achieve regret of $\eps$ times the optimal cost. We believe that our result has prominent applications in the emerging area of computational advertising, in particular targeted online advertising and advertising in social networks.

연구 동기 및 목표

  • 기존 강화학습 알고리즘이 고차원 선형정합(LQ) 시스템에서 상태 차원 $ p $에 따라 악화되는 스케일링 문제를 해결하기 위해.
  • 상태 차원 $ p \gg 1 $ 인 고차원 환경에서 최소한의 리그레트로 근사 최적 성능을 달성하는 적응형 제어 방식을 개발하기 위해.
  • 시스템 행렬 $ A^0 $ 및 $ B^0 $ 의 희소성을 활용하여, 뿌리 $ O(\log(p+r)) $ 개의 관측치로 정확하고 효율적인 매개변수 추정을 가능하게 하기 위해.
  • 차원 $ p $ 에 대해 우아하게 스케일링되는 리그레트 한계를 확립하여, $ \text{polylog}(p) \cdot O(1/\epsilon^2) $ 시간 내에 $ (1+\epsilon) $-최적 비용을 달성하기 위해.

제안 방법

  • 불확실성에 대한 낙관주의(OFU) 원리를 활용하여 신뢰집합 내에서 가장 낙관적인 매개변수 추정치를 선택함으로써 탐색을 보장하고 최적 제어로의 수렴을 확보한다.
  • 추정된 시스템 매개변수 $ \widetilde{\Theta}_t $ 를 중심으로 한 신뢰집합 $ \Omega_t $ 를 구성하며, 높은 확률로 $ \Theta^0 \in \Omega_t $ 가 되도록 보장한다.
  • 누적 비용과 최적 비용 간의 관계를 세 가지 오차 항 $ C_1, C_2, C_3 $ 를 통해 비용 분해 기법을 활용하여 연결한다. 이 오차 항들은 높은 확률 사례에서 유한하게 제한된다.
  • 두 가지 핵심 사건인 $ \mathcal{E}_1 $ (진짜 매개변수가 신뢰집합 내에 있음) 과 $ \mathcal{E}_2 $ (노이즈가 유한함) 를 도입하여 리그레트의 높은 확률 한계를 유도한다.
  • 집중 불등식과 리카티 연산자 $ K(\widetilde{\Theta}_t) $ 의 스펙트럴 노름 한계를 적용하여 추정 오차 및 제어 오차의 성장을 통제한다.
  • $ A^0 $ 과 $ B^0 $ 의 희소성을 활용하여 효과적인 매개변수 수를 감소시켜, 적은 샘플 수로 정확한 추정이 가능하게 하고 리그레트 스케일링을 향상시킨다.

실험 결과

연구 질문

  • RQ1고차원 LQ 시스템에서 상태 차원 $ p $ 에 대해 다항식적으로 스케일링되는 리그레트 한계를 갖는 강화학습 알고리즘이 존재할 수 있는가?
  • RQ2시스템 동역학의 희소성을 활용하면, 적응형 제어 알고리즘의 샘플 효율성과 리그레트 스케일링이 크게 향상되는가?
  • RQ3OFU 기반 알고리즘이 $ p $ 에 대해 다항로그 시간 내에 $ (1+\epsilon) $-최적 성능을 달성할 수 있는가, 즉 지수 시간이 아닌가?
  • RQ4시스템 행렬이 희소한 경우와 밀도가 높은 경우를 비교할 때, 리그레트는 어떻게 차원에 따라 스케일링되는가?

주요 결과

  • 제안된 알고리즘은 $ O(p\sqrt{T}) $ 의 리그레트 한계를 달성하며, 이는 밀도가 높은 시스템에 대한 이전의 $ O(p^{p+r+2}\sqrt{T}) $ 한계에 비해 크게 향상된 결과이다.
  • 알고리즘은 $ T = \text{polylog}(p) \cdot O(1/\epsilon^2) $ 시간 단계 이후에 평균 비용을 최적 비용의 $ (1+\epsilon) $ 이내로 달성하여 고차원 환경에서의 빠른 수렴을 가능하게 한다.
  • 희소 시스템 행렬을 가정할 경우, 뿌리 $ O(\log(p+r)) $ 개의 관측치로 정확한 매개변수 추정이 가능하여 효율적인 학습이 가능하다.
  • 리그레트 한계는 높은 확률로 세 오차 항 $ C_1, C_2, C_3 $ 로 분해되며, 이는 집중 및 스펙트럴 노름 기법을 통해 각각 유한하게 제한된다.
  • 분석 결과, 희소성과 철저한 신뢰집합 설계 덕분에 리그레트가 $ p $ 에 대해 선형으로 스케일링되며 지수적으로 증가하지 않음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.