Skip to main content
QUICK REVIEW

[論文レビュー] On the expected number of different records in a random sample

Marco Ferrante, Nadia Frigo|arXiv (Cornell University)|Sep 20, 2012
Bayesian Methods and Mixture Models参考文献 3被引用数 10
ひとこと要約

この論文は、離散的分布からのk個の異なるレコードを観測するために必要なi.i.d.抽出回数の期待値を導出し、特にマンデルブロ分布に注目している。期待値E[Xₘ(k)]の正確な公式を提示し、ヒープの法則からの漸近的結果を用いた計算的に実行可能な近似を提案しており、k ≪ m^{θ−1}の条件下でシミュレーションと強い一致を示している。

ABSTRACT

Given a discrete distribution, an interesting problem is to determine the minimum size of a random sample drawn from this distribution, in order to observe a given number of different records. This problem is related with many applied problems, like the Heaps' Law in linguistics and the classical Coupon-collector's problem. In this note we are able to compute theoretically the expected size of such a sample and we provide an approximation strategy in the case of the Mandelbrot distribution.

研究の動機と目的

  • 離散的分布からのk個の異なるレコードを観測するために必要な抽出回数の期待値を計算すること。特にマンデルブロ分布を対象とする。
  • すべてのm種類ではなく、k個の異なるタイプを集めるという、コラムコレクター問題の変種に対処すること。
  • mが大きくなり、正確な計算が非現実的になる場合に、E[Xₘ(k)]の実用的な近似を構築すること。
  • ヒープの法則からの漸近的結果とシミュレーションを用いて、近似の妥当性を検証すること。
  • マンデルブロモデル下で、E[Rₘ(n)]とE[Xₘ(k)]の関数的逆関係を確立すること。

提案手法

  • X₁ + ⋯ + XₖとしてE[Xₘ(k)]の正確な公式を導出。ここでXᵢはi番目の新しいレコードを取得するまでの抽出回数(幾何分布に従う待ち時間)である。
  • インジケータ変数と包含・除外原理を用いて、待ち時間分布の生存関数を介してE[Xₘ(k)]を表現する。
  • ヴァン・レイエンホルストとヴァン・デル・ヴァイデ(2004年)の漸近的結果を適用:E[Rₘ(n)] ∼ αn^β で、β = θ⁻¹、α = a_∞^βΓ(1−β)。ここでa_∞は無限サポートを持つマンデルブロ分布の正規化定数である。
  • k ≪ τの領域で有効な逆近似E[Xₘ(k)] ∼ (k/α)^θを提案。ここでτ ≈ m^{θ−1}である。
  • 小規模なmおよびk ≤ 8の場合はRを用いた数値計算により正確な公式の妥当性を検証。
  • 大規模なmに対してはモンテカルロシミュレーションを実施し、E[Xₘ(k)]の推定値と提案された近似値を比較。

実験結果

リサーチクエスチョン

  • RQ1確率が既知の離散的分布からのk個の異なるレコードを観測するために必要な抽出回数の正確な期待値は何か?
  • RQ2特にkが小さく、mが中程度のとき、マンデルブロ分布下での期待的サンプルサイズE[Xₘ(k)]はどのように振る舞うか?
  • RQ3E[Rₘ(n)]とE[Xₘ(k)]の逆関係を活用して、E[Xₘ(k)]の取り扱いやすい近似を導出できるか?
  • RQ4提案された近似E[Xₘ(k)] ∼ (k/α)^θの有効範囲は何か?
  • RQ5k ≪ m^{θ−1}の条件下で、近似値はシミュレーションによるE[Xₘ(k)]の値とどの程度一致するか?

主な発見

  • 正確な期待値E[Xₘ(k)]は計算が非常に高コストであり、Rによる実装によりk ≤ 8および小規模なmでのみ現実的であることが示された。
  • m = 10、k = 8の場合、期待される抽出回数は約43.66であり、このサイズのサンプルにおける異なる語の期待数は7.74である。
  • m = 100のとき、k < 90の範囲ではE[Rₘ(n)]とE[Xₘ(k)]の逆関係が良好に成立するが、kがmに近づくと乖離が生じる。
  • m = 500のとき、k ≤ 25の範囲で、提案された近似E[Xₘ(k)] ∼ (k/α)^θはシミュレーション値と非常に良好に一致した。
  • 近似はk ≪ m^{θ−1}の領域で有効であり、τ ≈ m^{θ−1}が適用範囲の境界を示している。
  • c = 0.30、θ = 1.75のとき、無限級数の正規化定数a_∞から導かれる漸近的パラメータα ≈ 0.558が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。