Skip to main content
QUICK REVIEW

[논문 리뷰] Tight Concentrations and Confidence Sequences from the Regret of Universal Portfolio

Francesco Orabona, Kwang-Sung Jun|arXiv (Cornell University)|2021. 10. 27.
Advanced Bandit Algorithms Research참고 문헌 22인용 수 4
한 줄 요약

이 논문은 유니버설 포트폴리오 알고리즘의 손실을 활용하여 유계 랜덤 변수에 대해 날카롭고 시간에 관계없이 유효한 신뢰 구간을 유도하는 새로운 방법을 제안한다. 유니버설 포트폴리오의 비한계 베팅 비율 처리 능력을 활용해, 단일 표본으로도 비어 있지 않은 신뢰 구간을 생성하며, 渐近적으로 최적의 성능을 달성하며 반복 로그 법칙을 만족한다.

ABSTRACT

A classic problem in statistics is the estimation of the expectation of random variables from samples. This gives rise to the tightly connected problems of deriving concentration inequalities and confidence sequences, that is confidence intervals that hold uniformly over time. Previous work has shown how to easily convert the regret guarantee of an online betting algorithm into a time-uniform concentration inequality. In this paper, we show that we can go even further: We show that the regret of universal portfolio algorithms give rise to new implicit time-uniform concentrations and state-of-the-art empirically calculated confidence sequences. In particular, our numerically obtained confidence sequences can never be vacuous, even with a single sample, and satisfy the law of iterated logarithm.

연구 동기 및 목표

  • 단일 표본으로도 비어 있지 않은 신뢰 구간을 유지하는 시간에 관계없이 유효한 신뢰 구간을 개발하는 것.
  • 시간에 관계없이 유효성을 유지하면서도, 구간 너비 측면에서 최신 기술 수준의 경험적 성능를 달성하는 것.
  • 유니버설 포트폴리오 손실 기반으로 새로운 암묵적 농도 불등식을 유도하는 것.
  • 실수적이고 기호적 역행렬을 통해 실용적이고 이론적으로 활용 가능한 신뢰 구간을 가능하게 하는 것.
  • 장기적으로 최적의 행동을 보장하기 위해 渐近적으로 반복 로그 법칙을 만족하는 것.

제안 방법

  • 특히 Dirichlet(1/2,1/2) 혼합을 사용한 Cover-Ordentlich 유니버설 포트폴리오를 활용하여 시간에 관계없이 유효한 농도 불등식을 유도하는 데 기초로 하는, 유니버설 포트폴리오 알고리즘의 손실 보장 기반.
  • 연속된 동전에 베팅하는 문제를 두 자산 포트폴리오 선택 문제로 환원하여, [−1/(1−m), 1/m] 범위 내에서 비한계 베팅 비율을 허용함으로써 초기 표본 성능을 향상시키는 방법.
  • 암묵적 농도 불등식을 수치적으로 역행렬하여 PRECiSE-CO96를 도출함. 이는 표본당 O(1) 복잡도를 가지며, 단일 표본으로도 비어 있지 않은 구간을 제공하는 신뢰 구간 알고리즘.
  • 농도 불등식을 기호적으로 역행렬하여, 시간에 관계없이 유효한 에르미트-베르너 타입의 불등식을 도출.
  • 정확한 역행렬과 동일한 渐近적 성능를 가지며, 빠른 수치적 역행렬을 가능하게 하는 PRECiSE-A-CO96를 도입.
  • Robbins(1970)의 혼합을 활용하여, 반복 로그 법칙을 만족하는 최적의 渐近적 행동을 달성하는 PRECiSE-R70을 개발.

실험 결과

연구 질문

  • RQ1유니버설 포트폴리오 알고리즘의 손실을 활용해, 단일 표본으로도 날카롭고 비어 있지 않은 시간에 관계없이 유효한 농도 불등식을 도출할 수 있는가?
  • RQ2포트폴리오 손실에서 도출된 암묵적 농도 불등식을 어떻게 수치적으로 역행렬하여 최소한의 계산 비용으로 실용적인 신뢰 구간을 도출할 수 있는가?
  • RQ3유도된 신뢰 구간이 반복 로그 법칙을 渐 asymptotically 만족하는 최적의 장기적 행동을 달성할 수 있는가?
  • RQ4기존의 고정 이산화 방법에 비해, 유니버설 포트폴리오 프레임워크에서 비한계 베팅 비율을 허용함으로써 어떤 이점이 있는가?
  • RQ5dKelly 및 Clopper-Pearson와 같은 기존 방법들과 비교하여, 제안된 방법이 간격 너비와 균일성 측면에서 경험적으로 어떻게 성능을 내는가?

주요 결과

  • PRECiSE-CO96는 유니버설 포트폴리오 프레임워크가 제공하는 비한계 베팅 비율 범위 덕분에, 표본 수에 관계없이 비어 있지 않은 신뢰 구간을 생성한다. 이는 단일 표본일 경우에도 해당된다.
  • 손실 기반 농도 불등식의 수치적 역행렬을 통해 도출된 신뢰 구간은 단일 표본일 경우에도 너비가 1 이하가 되며, 경험적 분산에 의존하는 기존 방법보다 뛰어난 성능을 보인다.
  • PRECiSE-R70는 반복 로그 법칙을 충족하는 渐 asymptotically 성능을 달성하여, 10^5개 표본에서 Howard 등(2021)의 방법을 압도한다.
  • 농도 불등식의 기호적 역행렬을 통해 시간에 관계없이 유효한 에르미트-베르너 타입의 불등식을 도출하였으며, 이는 신뢰 구간의 새로운 이론적 기반을 제공한다.
  • Dirichlet(1/2,1/2) 혼합 기반 방법은 정확한 역행렬과 동일한 渐 asymptotically 최적성을 유지하면서도, 표본당 O(1) 복잡도로 더 빠른 수치적 역행렬을 가능하게 하여, PRECiSE-A-CO96를 도입한다.
  • 단일 표본일지라도, PRECiSE-CO96는 해당 분포에 대한 사전 지식이 없음에도 불구하고, Clopper-Pearson 정확한 신뢰 구간의 행동을 매우 잘 따라간다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.