Skip to main content
QUICK REVIEW

[논문 리뷰] Optimal Policies for Observing Time Series and Related Restless Bandit Problems

Christopher R. Dance, Tomi Silander|arXiv (Cornell University)|2017. 03. 29.
Advanced Bandit Algorithms Research인용 수 8
한 줄 요약

이 논문은 비용이 드는 관측을 수반하는 선형-정현-가우시안 제어 문제의 일종에 대해, 시간 시리즈를 관측하는 최적 정책이 임계 임계값을 초과할 경우에만 관측하는 임계값 정책임을 증명한다. 이 결과는 활성화되지 않은 베이저 문제로 확장되어 잘 정의된 윌틀 인덱스의 존재를 보여주며, 새로운 검증 정리와 기계적 단어, 비선형 역학 간의 연결을 바탕으로 한다.

ABSTRACT

The trade-off between the cost of acquiring and processing data, and uncertainty due to a lack of data is fundamental in machine learning. A basic instance of this trade-off is the problem of deciding when to make noisy and costly observations of a discrete-time Gaussian random walk, so as to minimise the posterior variance plus observation costs. We present the first proof that a simple policy, which observes when the posterior variance exceeds a threshold, is optimal for this problem. The proof generalises to a wide range of cost functions other than the posterior variance. This result implies that optimal policies for linear-quadratic-Gaussian control with costly observations have a threshold structure. It also implies that the restless bandit problem of observing multiple such time series, has a well-defined Whittle index. We discuss computation of that index, give closed-form formulae for it, and compare the performance of the associated index policy with heuristic policies. The proof is based on a new verification theorem that demonstrates threshold structure for Markov decision processes, and on the relation between binary sequences known as mechanical words and the dynamics of discontinuous nonlinear maps, which frequently arise in physics, control and biology.

연구 동기 및 목표

  • 스칼라 가우시안 시간 시리즈에 대해 비용이 드는 노이지 관측을 최소화하는 데 있어 임계값 기반 관측 정책의 최적성을 확립하기 위해.
  • 이 결과를 비용이 드는 관측을 수반하는 선형-정현-가우시안(LQG) 제어 문제로 확장하여 최적 정책의 임계값 구조를 증명하기 위해.
  • 다중 시간 시리즈를 관측하는 활성화되지 않은 베이저 문제에 대해 잘 정의된 윌틀 인덱스가 존재하는지 확인하기 위해.
  • 윌틀 인덱스에 대한 닫힌 형식의 표현식을 도출하고, 히우리스틱 정책과의 성능 비교를 통해 관련 인덱스 정책의 성능을 평가하기 위해.

제안 방법

  • 최적 정책의 임계값 구조를 증명하기 위해 마코프 결정 과정에 대한 새로운 검증 정리를 개발하였다.
  • 비연속 비선형 사상의 역학과 기계적 단어—물리학 및 제어 이론에서 나타나는 이진 수열—간의 연결을 사용하였다.
  • 다른 관측 행동 하에서 사후 평균과 분산 전이를 모델링하기 위해 칼만 필터를 적용하였다.
  • 모비우스 변환을 사용하여 사후 분산에 대한 결정론적 동적 프로그래밍으로 관측 제어 문제를 축소하였다.
  • 특정 비용 함수 하에서 동적 프로그래밍을 풀어 윌틀 인덱스에 대한 닫힌 형식의 표현식을 유도하였다.
  • LQG 제어의 제어 및 관측 하위문제를 분리하기 위해 형태가 $ V(x,v) = Rx^2 + Rv + g(v) $ 인 시험 해를 활용하였다.

실험 결과

연구 질문

  • RQ1가우시안 시간 시리즈에서 사후 분산과 관측 비용의 합을 최소화하기 위해 어떤 조건에서 임계값 정책이 최적일까?
  • RQ2비용이 드는 관측을 수반하는 LQG 제어의 최적 정책은 사후 분산에 대해 임계값 구조를 보일까?
  • RQ3다중 시간 시리즈를 관측하는 활성화되지 않은 베이저 문제는 윌틀 인덱스를 통해 해결 가능할까? 만약 가능하다면 닫힌 형식으로 계산 가능한가?
  • RQ4시뮬레이션에서 인덱스 정책의 성능은 히우리스틱 정책과 비교해 어떻게 되는가?

주요 결과

  • 사후 분산이 임계값을 초과할 경우에만 관측하는 임계값 정책이 사후 분산과 관측 비용의 합을 최소화하는 데 최적이다.
  • 비용이 드는 관측을 수반하는 LQG 제어의 최적 정책은 사후 분산에 대한 임계값 정책과 선형 피드백 제어 법칙의 조합이다.
  • 다중 시간 시리즈의 활성화되지 않은 베이저 문제에 대한 윌틀 인덱스는 잘 정의되어 있으며, 유도된 동적 프로그래밍을 통해 닫힌 형식으로 계산 가능하다.
  • 윌틀 인덱스는 $ A, B, D, F, \Sigma_Y(a), c(a) $, 및 $ \beta $와 같은 시스템 매개변수의 함수로 명시적으로 유도되었다.
  • 수치적 비교에서 인덱스 정책의 성능이 히우리스틱 정책을 능가함을 보였다.
  • 증명은 새로운 검증 정리에 기반하며, 최적 제어의 맥락에서 기계적 단어와 비연속 비선형 사상의 역학 간의 깊은 연결을 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.