Skip to main content
QUICK REVIEW

[論文レビュー] Finding Associations and Computing Similarity via Biased Pair Sampling

Andrea Campagna, Rasmus Pagh|IT University Of Copenhagen (IT University of Copenhagen)|Oct 1, 2009
Data Mining Algorithms and Applications参考文献 16被引用数 9
ひとこと要約

本稿では、サポートプルーニングを適用しない大規模な取引データセットにおける類似度計算および関連性探索を、効率的に実行するためのバイアス付きサンプリング手法BiSamを提案する。頻度に基づいてアイテムペアをサンプリングし、新たなバイアス戦略を用いることで、正確なカウントと比較して著しく高速化(しばしば10倍以上)を達成する。特に取引が大きく、アイテムのサポートが中程度から高い場合に顕著であり、偽陰性率も低く抑えられる。

ABSTRACT

This version is ***superseded*** by a full version that can be found at http://www.itu.dk/people/pagh/papers/mining-jour.pdf, which contains stronger theoretical results and fixes a mistake in the reporting of experiments. Abstract: Sampling-based methods have previously been proposed for the problem of finding interesting associations in data, even for low-support items. While these methods do not guarantee precise results, they can be vastly more efficient than approaches that rely on exact counting. However, for many similarity measures no such methods have been known. In this paper we show how a wide variety of measures can be supported by a simple biased sampling method. The method also extends to find high-confidence association rules. We demonstrate theoretically that our method is superior to exact methods when the threshold for "interesting similarity/confidence" is above the average pairwise similarity/confidence, and the average support is not too low. Our method is particularly good when transactions contain many items. We confirm in experiments on standard association mining benchmarks that this gives a significant speedup on real data sets (sometimes much larger than the theoretical guarantees). Reductions in computation time of over an order of magnitude, and significant savings in space, are observed.

研究の動機と目的

  • 正確なカウントにおける計算ボトルネック、特にサポートプルーニングを適用しない場合の問題を解決すること。
  • 全ペアの列挙を回避して、さまざまな類似度測定(例:ジャカード、コサイン、リフト)および高信頼度の関連ルールを効率的に計算できること。
  • 平均取引サイズが大きいデータセットにおいて、類似度ベースの関連性抽出における時間的・空間的計算量を低減すること。
  • 正確なカウントやLSHベースの手法に対する理論的裏付けのある、誤差の境界が保証されたサンプリングベースの代替手法を提供すること。
  • 現代のデータマイニングワークロードにおいて、CPU時間こそがI/Oやメモリ使用量よりも重要なボトルネックであることを示すこと、特に高速ストレージとメモリ内データ処理を想定して。

提案手法

  • 共起頻度に基づいてアイテムペアの優先順位を付けるバイアス付きサンプリング戦略を採用し、評価対象のペア数を削減する。
  • 閾値に基づくサンプリング方式を用い、期待される類似度や信頼度に比例する確率でペアを選択することで、有望な関連性に集中する。
  • 統計的サンプリングを用いて類似度と信頼度を推定し、誤差率を制御する。これにより、偽陰性確率を境界化可能(例:実験では2%未満)。
  • ジャカード、コサイン、リフト、およびall_confidenceを含む複数の類似度測定をサポートし、重複係数を介して高信頼度の関連ルールへの拡張も可能。
  • LSHや正確なカウントと同様に、全アイテムペア間でのトランザクションスキャンやシグネチャ比較を回避する。
  • 理論的分析により、類似度閾値Δが平均ペアワイズ類似度を上回り、サポートが低すぎない場合、BiSamが正確な手法を上回ることを示している。

実験結果

リサーチクエスチョン

  • RQ1正確なカウントを用いずに、ジャカード、コサイン、リフトなどの類似度測定を効率的に計算するために、バイアス付きサンプリングを用いることができるか?
  • RQ2時間、空間、正確性の観点から、BiSamは正確なカウントやLSHベースの手法と比較してどのように性能を発揮するか?
  • RQ3どのようなデータ条件(例:取引サイズ、アイテムサポート)下でBiSamが最大の高速化を達成するか?
  • RQ4BiSamは、誤差制御が保証された高信頼度の関連ルールの抽出に拡張可能か?
  • RQ5現代のメモリ内データマイニングワークロードにおいて、CPU時間はI/Oやメモリ使用量よりもより重要なボトルネックであるか?

主な発見

  • Kosarak、Pumsb、T40I10D100Kなどのデータセットにおいて、BiSamは正確なカウントと比較して10倍以上の高速化を達成し、時間比は最大36.14に達した。
  • Kosarakデータセットでは、計算時間を31.3億から1.48億回の演算に削減(21倍の高速化)し、メモリ使用量も3310万単位から479万単位にまで削減した。
  • DirectorsActorデータセットでは、平均取引サイズが非常に大きかったにもかかわらず、アイテムサポートが低かったため、高速化は7.64倍にとどまった。これはサポートレベルの重要性を裏付けた。
  • BiSamのメモリ使用量は、正確なカウントと比較して一貫して低く、データセット全体で1.17〜7.95の空間削減比を示した。
  • μ=15の実験では偽陰性確率がわずか1.8%にとどまり、強力な誤差制御を実現した。
  • 特に異なるアイテム数が多い場合に顕著で、LSHベースの手法と比較して空間効率に優れている。これは、すべてのハッシュシグネチャペア間の比較を回避できる点に起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。