Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to detect an oddball target with observations from an exponential family

Gayathri R Prabhu, Srikrishna Bhashyam|arXiv (Cornell University)|2017. 12. 11.
Advanced Bandit Algorithms Research참고 문헌 9인용 수 9
한 줄 요약

이 논문은 알려지지 않은 파rameter를 가진 다항 보상 밴딧에서 벡터 지수형 가족에서 온 관측값을 사용하여 이상 팔을 탐지하기 위한 순차 정책을 제안한다. 이 정책은 공액 사전을 사용하여 수정된 일반화된 유사도 비율 검정을 적용하여 잘못된 탐지 확률이 유한함을 보장한다. 이 정책은 총 비용(기대 시간 + 전환 비용)을 최소화하는 데 있어 渐近적으로 최적이며, α는 잘못된 탐지 임계값이고 D*는 최적의 상대 엔트로피 기반 스케일링 인자이므로 log(1/α)/D* 비율로 스케일링된다.

ABSTRACT

The problem of detecting an odd arm from a set of K arms of a multi-armed bandit, with fixed confidence, is studied in a sequential decision-making scenario. Each arm's signal follows a distribution from a vector exponential family. All arms have the same parameters except the odd arm. The actual parameters of the odd and non-odd arms are unknown to the decision maker. Further, the decision maker incurs a cost for switching from one arm to another. This is a sequential decision making problem where the decision maker gets only a limited view of the true state of nature at each stage, but can control his view by choosing the arm to observe at each stage. Of interest are policies that satisfy a given constraint on the probability of false detection. An information-theoretic lower bound on the total cost (expected time for a reliable decision plus total switching cost) is first identified, and a variation on a sequential policy based on the generalised likelihood ratio statistic is then studied. Thanks to the vector exponential family assumption, the signal processing in this policy at each stage turns out to be very simple, in that the associated conjugate prior enables easy updates of the posterior distribution of the model parameters. The policy, with a suitable threshold, is shown to satisfy the given constraint on the probability of false detection. Further, the proposed policy is asymptotically optimal in terms of the total cost among all policies that satisfy the constraint on the probability of false detection.

연구 동기 및 목표

  • 다양한 팔의 진짜 파rameter가 알려지지 않은 다항 보상 밴딧에서 관측값이 벡터 지수형 가족에서 온 이상 팔을 탐지하는 문제를 다루는 것.
  • 각 팔 전환이 비용을 수반하는 순차 탐지 프레임워크에 전환 비용을 통합하는 것.
  • 잘못된 탐지 확률에 대한 고정된 신뢰도 제약 조건을 충족하면서 총 비용(기대 시간 + 전환 비용)을 최소화하는 정책을 설계하는 것.
  • 이전의 포아송 분포 관측값에 대한 연구를 더 넓은 지수형 가족 분포 계열으로 일반화하는 것.
  • 총 비용에 대한 정보 이론적 하한선을 수립하고, 제안된 정책이 이 하한선을 渐近적으로 달성함을 보여주는 것.

제안 방법

  • 모르는 파rameter에 대한 인위적인 공액 사전을 평균화하여 검정 통계량을 안정화하는 수정된 일반화된 유사도 비율 검정(GCRT)을 사용한다.
  • 지수형 가족에 대해 공액 사전을 사용하여 각 단계에서 효율적이고 닫힌 형태의 사후 분포 갱신을 가능하게 한다.
  • 시간에 따라 변하지 않는 임계값 정책을 사용하여 로그-유사도 비율 통계량을 기반으로 언제 샘플링을 중단하고 이상 팔을 선언할지를 결정한다.
  • 상대 엔트로피와 로그-파트션 함수의 볼록 쌍대 함수를 사용하여 총 비용에 대한 정보 이론적 하한선을 유도한다.
  • 상대 엔트로피에 기반한 분포 간의 최적 비율을 유도하여 관측값을 할당하는 샘플링 전략을 설계하여 하한선과 渐近적으로 일치시킨다.
  • 잘못된 탐지 확률이 α 이하가 되도록 보장하기 위해 일반화된 유사도 비율 통계량에 기반한 임계값 규칙을 사용한다.

실험 결과

연구 질문

  • RQ1고정된 신뢰도 제약 조건 하에서 이상 팔 탐지에 대한 총 비용(기대 시간 + 전환 비용)의 기본 하한선은 무엇인가?
  • RQ2지수형 가족 분포의 파rameter가 알려지지 않은 상황에서, 이 하한선을 渐近적으로 달성할 수 있는 순차 정책은 어떻게 설계할 수 있는가?
  • RQ3공액 사전은 제안된 정책에서 효율적이고 다루기 쉬운 사후 분포 갱신을 가능하게 하는 데 어떤 역할을 하는가?
  • RQ4전환 비용의 포함은 순차적 이상 팔 탐지에서 최적의 샘플링 전략과 총 비용에 어떤 영향을 미치는가?
  • RQ5제안된 정책이 잘못된 탐지 제약 조건을 만족하는 모든 정책 중에서 총 비용 측면에서 渐近적으로 최적임을 입증할 수 있는가?

주요 결과

  • 제안된 정책은 총 비용에 대한 정보 이론적 하한선을 渐近적으로 달성하며, 총 비용은 α가 잘못된 탐지 임계값이고 D*가 최적의 상대 엔트로피 기반 스케일링 인자이므로 log(1/α)/D* 비율로 스케일링된다.
  • 잘못된 탐지 확률이 α 이하가 되도록 보장하기 위해 일반화된 유사도 비율 통계량에 대해 신중하게 선택된 임계값을 통해 정책이 성립한다.
  • 정책의 샘플링 전략은 목표 잘못된 탐지 확률 α가 0에 수렴할수록 하한선에서 제안된 최적 할당에 수렴한다.
  • 공액 사전의 사용은 단순하고 효율적인 사후 분포 갱신을 가능하게 하여 실시간 구현에 있어 계산적으로 다루기 쉬운 정책을 만든다.
  • 모든 잘못된 탐지 제약 조건을 만족하는 정책 중에서 기대 시간과 총 전환 비용의 합을 최소화하는 데 있어 정책은 渐近적으로 최적이다.
  • 분석은 이전의 포아송 분포 관측값 연구를 전체적인 벡터 지수형 가족 분포 계열로 일반화하여 정규분포, 이항분포, 감마분포와 같은 다양한 모델을 통합한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.