Skip to main content
QUICK REVIEW

[論文レビュー] Generic Inverted Index on the GPU

Jingbo Zhou, Qi Guo|arXiv (Cornell University)|Mar 28, 2016
Advanced Image and Video Retrieval Techniques参考文献 66被引用数 7
ひとこと要約

この論文では、ドキュメント、シーケンス、高次元ベクトルなど、多様なデータタイプにおけるGPUアクセラレート型類似度検索を目的とした汎用逆インデックスフレームワークGENIEを提案する。局所性に敏感なハッシュ(LSH)と統一されたGPU並列処理を活用することで、複数の類似度測度において効率的な近似最近傍検索を実現するとともに、ハッシュ化済みデータと元のデータの両方をサポートし、実世界のデータセットにおいて高いパフォーマンスを達成する。

ABSTRACT

Data variety, as one of the three Vs of the Big Data, is manifested by a growing number of complex data types such as documents, sequences, trees, graphs and high dimensional vectors. To perform similarity search on these data, existing works mainly choose to create customized indexes for different data types. Due to the diversity of customized indexes, it is hard to devise a general parallelization strategy to speed up the search. In this paper, we propose a generic inverted index on the GPU (called GENIE), which can support similarity search of multiple queries on various data types. GENIE can effectively support the approximate nearest neighbor search in different similarity measures through exerting Locality Sensitive Hashing schemes, as well as similarity search on original data such as short document data and relational data. Extensive experiments on different real-life datasets demonstrate the efficiency and effectiveness of our system.

研究の動機と目的

  • ドキュメント、シーケンス、グラフ、ベクトルなどの異種データタイプにおける類似度検索を、1つのスケーラブルなフレームワーク内で統合的にサポートすること。
  • 各データタイプごとのカスタムインデックスの制限を克服するため、GPU並列処理に最適化された統一されたインデックスおよび検索システムを設計すること。
  • 局所性に敏感なハッシュ(LSH)を用いて、複数の類似度測度において効率的な近似最近傍検索を可能にすること。
  • データ固有のインデックス設計を必要とせず、変換済み(例:ハッシュ化済み)および元のデータ表現の両方における類似度検索をサポートすること。

提案手法

  • 異なる類似度測度に適したLSHスキームを用いて、データアイテムをハッシュバケットにマップする汎用逆インデックス構造を設計すること。
  • すべてのデータタイプにわたるインデックス構築およびクエリ処理を並列化するため、GPU最適化されたデータ構造およびカーネルルーチンを実装すること。
  • 同じフレームワーク内で二重のインデックスパスを維持することで、LSHによる近似検索と元のデータ上の正確検索の両方を可能にすること。
  • ハッシュ計算および候補取得中にスループットを最大化するため、GPUメモリのコalescingとスレッドブロックスケジューリングを活用すること。
  • クエリの類似度測定基準に応じて適切なLSHスキームを動的に選択する統一されたクエリ処理パイプラインを統合すること。
  • ワークロードに応じたメモリ管理を適用し、可変サイズのデータを処理しながらGPUメモリアクセスの遅延を低減すること。

実験結果

リサーチクエスチョン

  • RQ1各データタイプごとにカスタムインデックス設計を必要とせず、1つのGPU最適化インデックスフレームワークが多様なデータタイプにおける類似度検索を効率的にサポートできるか?
  • RQ2汎用逆インデックス内でのLSHの使用が、複数の類似度測度における近似最近傍検索の高速化にどの程度有効であるか?
  • RQ3提案されたGPU並列処理戦略は、CPUベースまたは専用インデックスソリューションと比較して、クエリスループットをどの程度向上させるか?
  • RQ4同じフレームワーク内で、LSHによる近似検索と元のデータ上の正確検索の両方を効率的にサポートできるか?

主な発見

  • GENIEは、多様なデータタイプにわたりGPU並列処理を活用することで、クエリ処理時間に顕著な高速化を達成し、CPUベースのベースラインを上回る性能を示した。
  • 適応可能なLSHスキームを用いることで、再インデックス化を伴わずに複数の類似度測度をカバーする効果的な近似最近傍検索が可能となった。
  • GENIEは、短いドキュメントや高次元ベクトルを含む実生活のデータセットにおいても高いスケーラビリティを示し、一貫したパフォーマンス向上を達成した。
  • 統一されたインデックスアプローチにより、異なるデータタイプごとに複数の専用インデックスを維持するのと比較して、開発工数の低減が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。