Skip to main content
QUICK REVIEW

[논문 리뷰] On the expected number of different records in a random sample

Marco Ferrante, Nadia Frigo|arXiv (Cornell University)|2012. 09. 20.
Bayesian Methods and Mixture Models참고 문헌 3인용 수 10
한 줄 요약

이 논문은 이산 확률분포에서 k개의 고유 기록을 관찰하기 위해 필요한 i.i.d. 표본 수의 기대값을 유도하며, 주로 만델브로 분포에 초점을 맞춘다. 기대값 E[Xₘ(k)]에 대한 정확한 공식을 제공하고, 히프스의 법칙에서 유도된 渐近 결과를 활용한 계산적으로 실현 가능한 근사치를 제안하며, k ≪ m^{θ−1}인 경우에 시뮬레이션 결과와 뛰어난 일치를 보인다.

ABSTRACT

Given a discrete distribution, an interesting problem is to determine the minimum size of a random sample drawn from this distribution, in order to observe a given number of different records. This problem is related with many applied problems, like the Heaps' Law in linguistics and the classical Coupon-collector's problem. In this note we are able to compute theoretically the expected size of such a sample and we provide an approximation strategy in the case of the Mandelbrot distribution.

연구 동기 및 목표

  • 이산 분포에서 k개의 고유 기록을 관찰하기 위해 필요한 표본 수의 기대값을 계산하는 것, 특히 만델브로 분포를 대상으로 한다.
  • 모든 m종류의 타입을 수집하는 것 대신 k개의 서로 다른 종류를 수집하는 것을 목표로 하는 쿠폰 수집자 문제의 변형을 다루는 것.
  • 정확한 계산이 큰 m에 대해 실현 불가능해지는 경우 E[Xₘ(k)]에 대한 실용적인 근사치를 개발하는 것.
  • 시뮬레이션과 히프스의 법칙에서 유도된 渐近 결과를 통해 근사치를 검증하는 것.
  • 만델브로 모델 하에서 E[Rₘ(n)]과 E[Xₘ(k)] 사이의 기능적 역관계를 설정하는 것.

제안 방법

  • X₁ + ⋯ + Xₖ로 표현되는 기하분포를 따르는 기다림 시간의 합으로서 E[Xₘ(k)]의 정확한 공식을 도출하며, 여기서 Xᵢ는 i번째 새로운 기록을 얻기까지의 표본 수이다.
  • 지표 변수와 포함-배제 원리를 사용하여 기다림 시간 분포의 생존함수를 통해 E[Xₘ(k)]를 표현한다.
  • van Leijenhorst와 van der Weide(2004)의 渐近 결과를 적용하여 E[Rₘ(n)] ∼ αn^β이며, β = θ⁻¹ 및 α = a_∞^βΓ(1−β)임을 도출한다. 여기서 a_∞는 무한지지 만델브로 분포의 정규화 상수이다.
  • k ≪ τ 인 영역에서 유효한 역관계 근사치 E[Xₘ(k)] ∼ (k/α)^θ를 제안한다. 여기서 τ ≈ m^{θ−1}이다.
  • 작은 m 및 k ≤ 8인 경우 R을 사용한 수치 계산을 통해 정확한 공식을 검증한다.
  • 더 큰 m에 대해 몬테카를로 시뮬레이션을 수행하여 E[Xₘ(k)]를 추정하고 제안된 근사치와 비교한다.

실험 결과

연구 질문

  • RQ1알려진 확률을 가진 이산 분포에서 k개의 고유 기록을 관찰하기 위해 필요한 표본 수의 정확한 기대값은 무엇인가?
  • RQ2특히 작은 k와 중간 크기의 m에 대해 만델브로 분포 하에서 기대 표본 크기 E[Xₘ(k)]는 어떻게 행동하는가?
  • RQ3E[Rₘ(n)]과 E[Xₘ(k)] 사이의 역관계를 활용하여 E[Xₘ(k)]에 대한 실용적인 근사치를 도출할 수 있는가?
  • RQ4제안된 근사치 E[Xₘ(k)] ∼ (k/α)^θ의 유효 범위는 무엇인가?
  • RQ5k ≪ m^{θ−1}인 경우에 근사치는 시뮬레이션된 E[Xₘ(k)] 값과 얼마나 잘 일치하는가?

주요 결과

  • 정확한 기대값 E[Xₘ(k)]는 계산적으로 매우 부담스럽고, R 구현을 통해 확인한 바, 작은 k(≤ 8)와 작은 m에 대해서만 실현 가능하다.
  • m = 10이고 k = 8일 경우 기대 표본 수는 약 43.66이며, 이 크기의 표본에서 고유 단어의 기대 수는 7.74이다.
  • m = 100일 경우 k < 90일 동안 E[Rₘ(n)]과 E[Xₘ(k)] 사이의 역관계가 잘 유지되지만, k가 m에 가까워지면 점점 산산이 갈라진다.
  • m = 500일 경우 k ≤ 25일 동안 제안된 근사치 E[Xₘ(k)] ∼ (k/α)^θ가 시뮬레이션된 값과 뛰어난 일치를 보인다.
  • 근사치는 k ≪ m^{θ−1}인 영역에서 유효하며, τ ≈ m^{θ−1}이 적용 가능성을 결정하는 경계로 작용한다.
  • c = 0.30 및 θ = 1.75일 경우, 무한급수 정규화 상수 a_∞에서 유도된 渐近 파라미터 α ≈ 0.558을 도출한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.