Skip to main content
QUICK REVIEW

[論文レビュー] Universal distribution of the empirical coverage in split conformal prediction

Paulo C. Marques F.|arXiv (Cornell University)|Mar 5, 2023
Statistical Methods and Inference被引用数 4
ひとこと要約

本稿は、交換可能性のもとでの分割順応的予測における経験的カバレッジの正確な有限標本分布および漸近的分布を確立する。任意の名目誤差率レベル α およびキャリブレーション標本サイズ n に対して、カバレッジ分布は、有限の予測数および将来の予測数が無限に増えるときのほとんど確実な極限において、常に Beta(⌈(1−α)(n+1)⌉, ⌊α(n+1)⌋) 分布に従うことが示された。

ABSTRACT

When split conformal prediction operates in batch mode with exchangeable data, we determine the exact distribution of the empirical coverage of prediction sets produced for a finite batch of future observables, as well as the exact distribution of its almost sure limit when the batch size goes to infinity. Both distributions are universal, being determined solely by the nominal miscoverage level and the calibration sample size, thereby establishing a criterion for choosing the minimum required calibration sample size in applications.

研究の動機と目的

  • 交換可能性のもとでの分割順応的予測における経験的カバレッジの正確な有限標本分布を同定すること。
  • 将来の予測数が無限に近づく際の経験的カバレッジのほとんど確実な極限分布を導出すること。
  • 両分布が、名目誤差率レベル α およびキャリブレーション標本サイズ n のみに依存する普遍的性質を確立すること。
  • 実用的な分割順応的予測応用におけるカバレッジのばらつきを理解する理論的基盤を提供すること。
  • 有限および漸近的条件下でのカバレッジの分布的挙動を定量化することで、実用的なキャリブレーション標本サイズの選択を支援すること。

提案手法

  • データの交換可能性を活用して、適合スコアおよびカバレッジ指標の交換可能性を確立する。
  • de Finetti の表現定理を適用し、カバレッジのほとんど確実な極限をベータ分布に従う確率変数としてモデル化する。
  • Pólya のアンズ方式を確率的アナロジーとして用い、経験的カバレッジの正確な有限時間分布を導出する。
  • de Finetti の混合測度に関する組合せ的積分を用いて、将来のカバレッジ $ C^{(n,\beta)}_m $ の正確な分布を $ m $, $ n $, および $ \alpha $ の関数として導出する。
  • 混合測度 $ \mu_\Theta $ をパラメータ $ b = \lceil(1-\alpha)(n+1)\rceil $, $ g = \lfloor\alpha(n+1)\rfloor $ のベータ分布として同定し、正確なカバレッジ則を導出する。
  • Scheffé の定理を適用して、名目レベルからのカバレッジの偏差の漸近的正規性を確立する。
Figure 1: Simulation of the future coverage discussed in Example 5 .
Figure 1: Simulation of the future coverage discussed in Example 5 .

実験結果

リサーチクエスチョン

  • RQ1交換可能性のもとでの分割順応的予測における経験的カバレッジの正確な有限標本分布は何か?
  • RQ2将来の予測数が増加する際の経験的カバレッジのほとんど確実な極限分布は何か?
  • RQ3経験的カバレッジの分布は、名目誤差率レベルおよびキャリブレーション標本サイズにどのように普遍的に依存するか?
  • RQ4この枠組みにおいて、de Finetti の定理および Pólya のアンズ方式を用いてカバレッジを特徴づけられるか?
  • RQ5名目レベル周辺にカバレッジが高確率で集中するためには、どの程度の標本サイズが必要か?

主な発見

  • 有限時間の予測数 $ m $ における経験的カバレッジ $ C^{(n,\alpha)}_m $ は、交換可能性および組合せ的積分を用いて導出された正確な分布を示し、これは $ \alpha $ および $ n $ のみに依存する。
  • 経験的カバレッジのほとんど確実な極限 $ C^{(n,\alpha)}_\infty $ は、$ \mathrm{Beta}(\lceil(1-\alpha)(n+1)\rceil, \lfloor\alpha(n+1)\rfloor) $ 分布に従う。これは交換可能性のもとで普遍的な結果である。
  • 極限カバレッジの期待値は $ \mathbb{E}[C^{(n,\alpha)}_\infty] = 1 - \alpha + O(1/n) $ であり、名目レベルへの漸近的一貫性を示している。
  • 極限カバレッジの分散は $ \mathrm{Var}[C^{(n,\alpha)}_\infty] = \frac{\alpha(1-\alpha)}{n} + O(1/n^2) $ であり、$ 1/\sqrt{n} $ のレートで収束していることが示唆される。
  • 正規化された偏差 $ \sqrt{n}(C^{(n,\alpha)}_\infty - (1-\alpha)) $ は、平均 0、分散 $ \alpha(1-\alpha) $ の正規分布に分布収束する。
  • 実用的なキャリブレーションにおいて、$ n = 860 $ の標本サイズをとれば、極限カバレッジが $ 1 - \alpha = 0.9 $ から $ \pm 0.02 $ の範囲内に収束する確率が 95% 以上となる。
Figure 2: A connection between split conformal prediction and Pólya’s urn scheme.
Figure 2: A connection between split conformal prediction and Pólya’s urn scheme.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。