QUICK REVIEW
[論文レビュー] Computing the Bergsma Dassios sign-covariance
Yair Heller, Ruth Heller|arXiv (Cornell University)|May 27, 2016
Random Matrices and Applications被引用数 11
ひとこと要約
この論文は、O(n²)時間でBergsma-Dassiosの符号共分散を計算する最適化されたアルゴリズムを提示している。従来のO(n² log n)およびO(n⁴)手法よりも改善されている。ランクに基づく事前処理と定数時間の範囲クエリを用いた効率的な累積分布の計算により、同定されたデータおよび同定されていないデータの両方に対して正確に、二次時間計算量を達成している。
ABSTRACT
Bergsma and Dassios (2014) introduced an independence measure which is zero if and only if two random variables are independent. This measure can be naively calculated in $O(n^4)$. Weihs et al. (2015) showed that it can be calculated in $O(n^2 \log n)$. In this note we will show that using the methods described in Heller et al. (2016), the measure can easily be calculated in only $O(n^2)$.
研究の動機と目的
- Bergsma-Dassiosの符号共分散の計算の計算量を、O(n⁴)およびO(n² log n)からO(n²)に低減すること。
- 同定済みおよび同定されていないデータの両方に対して、高速かつ正確に独立性の測度を計算可能にすること。
- Hellerら(2016)の手法が、この統計量に対して最適な時間計算量を達成するために適合可能であることを示すこと。
- 大規模な独立性検定に適した実用的でスケーラブルなアルゴリズムを提供すること。
提案手法
- 元のデータをランクに変換することで、離散的な順序対の組み合わせ的数え上げ問題に帰着する。
- O(n²)時間でグリッド上の動的計画法を用いて、ランク対の2次元経験的累積分布関数A(r,s)を構築する。
- 累積分布A(r,s)を用いて、各ペア(k,l)に対してO(1)時間でM<およびM>のカウントを範囲クエリで計算する。
- 同定データの場合は、同じランクに複数の観測値がある場合を扱うために、行単位の累積和を用いて累積構造を拡張する。
- A(r,s)から導出される補助的カウント(top, mid, bot, eqMin, eqMax)を用いて、各ペアごとにO(1)時間で不一致四重対のカウントNd(k,l)を計算する。
- 不一致の公式における複雑な最後の項を、同定観測値の二乗数を追跡する二次的な累積構造A(r,s)を用いて処理する。
実験結果
リサーチクエスチョン
- RQ1同定済みおよび同定されていないデータの両方に対して、Bergsma-Dassiosの符号共分散をO(n²)時間で計算できるか?
- RQ2ナイーブなO(n⁴)アプローチを上回る最小限の計算オーバーヘッドは何か?
- RQ3Hellerら(2016)が提示したランクに基づく累積分布技術を、Bergsma-Dassios統計量の完全な計算に適合可能か?
- RQ4実際の応用において、このO(n²)手法は従来のO(n² log n)手法と比較してどのように性能を発揮するか?
- RQ5同定が不一致四重対の構造に与える影響は何か?そして、それらはどのように効率的に数えることができるか?
主な発見
- ランクに基づく事前処理と累積分布グリッド上の定数時間範囲クエリを用いることで、Bergsma-Dassiosの符号共分散はO(n²)時間で計算可能である。
- 事前に計算されたA(r,s)行列に対するO(1)範囲クエリにより、同調四重対の数Ncが計算され、合計コストがO(n²)に低減される。
- 同定データの場合は、貢献をtop, mid, bot, および等価性項に分解し、それぞれをO(1)時間で取得可能であるため、不一致四重対のカウントNdを正しく計算する。
- 不一致の公式における最終補正項は、同定観測値の二乗数を追跡する二次的な累積構造を用いて計算され、ペアごとにO(1)で評価可能である。
- アルゴリズムは正確性を維持し、同定ランクや同一値を含むすべてのエッジケースを適切に処理し、あらゆるデータタイプで正しく動作する。
- 全体の時間計算量はO(n²)で最適であり、Weihsら(2015)が確立した従来のO(n² log n)の境界に対して顕著な改善を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。