Skip to main content
QUICK REVIEW

[論文レビュー] LSH Ensemble: Internet-Scale Domain Search

Erkang Zhu, Fatemeh Nargesian|arXiv (Cornell University)|Mar 24, 2016
Advanced Image and Video Retrieval Techniques参考文献 27被引用数 10
ひとこと要約

LSH Ensemble は、最小ハッシュと等深さパーティショニングを活用して、偏ったドメインサイズ分布を扱えるようにし、集合包含類似度(ジャカード集合包含スコア)に基づくインターネット規模のドメイン検索に適したスケーラブルで高精度なインデックス構造である。2億6200万件以上のドメインに対して3秒未塔のクエリ応答時間を達成し、ベースライン LSH と比較して最大15倍の高速化を実現しながら、精度も向上している。

ABSTRACT

We study the problem of domain search where a domain is a set of distinct values from an unspecified universe. We use Jaccard set containment, defined as $|Q \cap X|/|Q|$, as the relevance measure of a domain $X$ to a query domain $Q$. Our choice of Jaccard set containment over Jaccard similarity makes our work particularly suitable for searching Open Data and data on the web, as Jaccard similarity is known to have poor performance over sets with large differences in their domain sizes. We demonstrate that the domains found in several real-life Open Data and web data repositories show a power-law distribution over their domain sizes. We present a new index structure, Locality Sensitive Hashing (LSH) Ensemble, that solves the domain search problem using set containment at Internet scale. Our index structure and search algorithm cope with the data volume and skew by means of data sketches (MinHash) and domain partitioning. Our index structure does not assume a prescribed set of values. We construct a cost model that describes the accuracy of LSH Ensemble with any given partitioning. This allows us to formulate the partitioning for LSH Ensemble as an optimization problem. We prove that there exists an optimal partitioning for any distribution. Furthermore, for datasets following a power-law distribution, as observed in Open Data and Web data corpora, we show that the optimal partitioning can be approximated using equi-depth, making it efficient to use in practice. We evaluate our algorithm using real data (Canadian Open Data and WDC Web Tables) containing up over 262 M domains. The experiments demonstrate that our index consistently outperforms other leading alternatives in accuracy and performance. The improvements are most dramatic for data with large skew in the domain sizes. Even at 262 M domains, our index sustains query performance with under 3 seconds response time.

研究の動機と目的

  • 非常に偏ったドメインサイズ分布を示すオープンデータおよびウェブデータリポジトリにおけるスケーラブルで正確なドメイン検索の課題に対処すること。
  • ジャカード類似度ではなく、集合包含に基づく関連性(ジャカード集合包含)をサポートするインデックス構造を設計すること。
  • 固定の語彙やデータスキーマを仮定せずに、数億件のドメインに対する効率的で並列的かつメモリ効率の良いインデキシングとクエリ処理を可能にすること。
  • データパーティショニングを、精度を最大化し、誤検出を最小限に抑える最適化問題として定式化すること。
  • 実世界のデータセット(カナダのオープンデータおよびWDCウェブテーブル)を用いて、インターネット規模での評価を実施すること。

提案手法

  • 最小ハッシュを用いてドメインのコンactスケッチを生成し、局所性に敏感なハッシュ(LSH)を介して類似度推定を効率的に行う。
  • ドメインのサイズに基づいて複数のグループにパーティショニングする LSH エンsemble フレームワークを導入し、選別性を向上させ、誤検出を低減する。
  • コストモデルを用いてパーティショニングを最適化し、任意のデータ分布に対して最適なパーティショニングが存在することを証明する。
  • パワー則に従うデータに対しては、実装が効率的で効果的である等深さパーティショニングを用いて最適パーティショニングを近似する。
  • インデックスは複数のマシンに分散配置され、クエリはすべてのパーティションで並列処理され、結果がユニオンによって統合される。
  • データの偏りに応じて動的に調整され、各グループの誤検出率がバランスされるパーティショニングを採用する。

実験結果

リサーチクエスチョン

  • RQ1偏ったドメインサイズ分布のもとで、インターネット規模の集合包含ベースのドメイン検索をサポートするスケーラブルなインデックス構造を設計できるか?
  • RQ2最小ハッシュとLSHをデータパーティショニングと組み合わせることで、ドメイン検索における精度の向上と誤検出の低減をどのように達成できるか?
  • RQ3誤検出を最小限に抑えつつクエリ効率を維持するための、ドメインの最適なパーティショニング方法は何か?
  • RQ4パワー則に従うデータに対して、等深さパーティショニングは最適パーティショニングの有効な近似として機能するか?
  • RQ52億6000万件以上のドメインを含む実世界のデータセットにおいて、LSH エンsemble フレームワークの正確性と応答時間はどの程度か?

主な発見

  • LSH Ensemble は、2億6290万件のドメインを含むデータセットに対しても、3秒未塔のクエリ応答時間を維持し、強力なスケーラビリティを示している。
  • ベースライン MinHash LSH と比較して、クエリ性能が最大15倍向上し、特に偏りの強いデータで顕著な向上が見られた。
  • パワー則に従うドメインサイズ分布を示すデータセットに対しては、等深さパーティショニングが最適パーティショニングをよく近似でき、効率的で正確なインデキシングを可能にした。
  • パーティションサイズの標準偏差が5,556を超えて増加しても、LSH Ensemble の精度は安定しており、中程度のパーティショニングのずれに対しても頑健であることが示された。
  • インデキシングはデータサイズに比例してスケーリングされ、5台のマシンで並列インデキシングを実行しても、パーティション数に関係なく一貫したパフォーマンスを維持した。
  • パーティショニングによる選別性の向上のおかげで、LSH Ensemble のクエリコストはドメイン数の増加に伴いゆっくりと増加し、32パーティションでも低コストを維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。