[論文レビュー] Navigable Proximity Graph-Driven Native Hybrid Queries with Structured and Unstructured Constraints
本論文は、ナビゲーション可能な近接グラフ(NPG)に基づいて構築されたネイティブハイブリッドクエリ(NHQ)フレームワークを提案する。このフレームワークは、ハイブリッドクエリにおけるベクトル類似度検索と構造的属性フィルタリングを統合的に最適化する。特別な複合インデックス構造と共同プルーニングの統合により、NHQフレームワークは、8つの公開データセットおよび1つの社内データセットにおいて、最先端の手法と比較して最大10倍の高速化を達成しながらも、高い再現率を維持する。
As research interest surges, vector similarity search is applied in multiple fields, including data mining, computer vision, and information retrieval. {Given a set of objects (e.g., a set of images) and a query object, we can easily transform each object into a feature vector and apply the vector similarity search to retrieve the most similar objects. However, the original vector similarity search cannot well support extit{hybrid queries}, where users not only input unstructured query constraint (i.e., the feature vector of query object) but also structured query constraint (i.e., the desired attributes of interest). Hybrid query processing aims at identifying these objects with similar feature vectors to query object and satisfying the given attribute constraints. Recent efforts have attempted to answer a hybrid query by performing attribute filtering and vector similarity search separately and then merging the results later, which limits efficiency and accuracy because they are not purpose-built for hybrid queries.} In this paper, we propose a native hybrid query (NHQ) framework based on proximity graph (PG), which provides the specialized extit{composite index and joint pruning} modules for hybrid queries. We easily deploy existing various PGs on this framework to process hybrid queries efficiently. Moreover, we present two novel navigable PGs (NPGs) with optimized edge selection and routing strategies, which obtain better overall performance than existing PGs. After that, we deploy the proposed NPGs in NHQ to form two hybrid query methods, which significantly outperform the state-of-the-art competitors on all experimental datasets (10$ imes$ faster under the same extit{Recall}), including eight public and one in-house real-world datasets. Our code and datasets have been released at \url{https://github.com/AshenOn3/NHQ}.
研究の動機と目的
- ベクトル類似度検索と属性フィルタリングを別々のステップとして処理する従来のハイブリッドクエリ処理手法の非効率性と不正確さを是正すること。
- 非構造的(特徴ベクトル)および構造的(属性)制約を1回のクエリ実行でネイティブにサポートする統合的なフレームワークを設計すること。
- ハイブリッドクエリワークロードにおけるパフォーマンス向上を図るため、最適化されたエッジ選択およびルーティング戦略を備えた、改良型ナビゲーション可能な近接グラフ(NPG)を開発すること。
- 実世界および公開データセットにおいて、従来の最先端システムと比較して顕著なパフォーマンス向上を示すこと。
提案手法
- 近接グラフ(PG)構造を用いて、ベクトル類似度検索と属性フィルタリングを統合的に処理するネイティブハイブリッドクエリ(NHQ)フレームワークを提案する。
- PG内に特徴ベクトルと属性メタデータを統合した複合インデックス構造を導入し、ハイブリッドクエリ実行の効率を向上させる。
- 探索中の両方の検索空間(ベクトル類似度および属性制約)を同時に削減するための共同プルーニングモジュールを設計する。
- ハイブリッドクエリに最適化された、エッジ選択およびルーティング戦略を改善した2つの新規ナビゲーション可能なPG(NPG)を設計し、全体の検索パフォーマンスを向上させる。
- 提案されたNPGをNHQフレームワークに統合し、2つのハイブリッドクエリ手法(NHQ-NPG_kgraph および NHQ-NPG_sprawl)を構築する。
- ルーティング戦略に動的重み調整メカニズムを導入し、ベクトル類似度と属性制約の満たし具合のバランスを取る。
実験結果
リサーチクエスチョン
- RQ1非構造的および構造的制約を統合したハイブリッドクエリをネイティブにサポートする統合的フレームワークを設計可能か。これは、逐次処理に起因する非効率性を回避するものである。
- RQ2複合インデックス構造と共同プルーニングを用いることで、近接グラフをどのように改善し、ハイブリッドクエリパフォーマンスを向上させられるか。
- RQ3ハイブリッドクエリシナリオにおけるナビゲーション可能な近接グラフの最適なエッジ選択およびルーティング戦略は何か。
- RQ4提案されたNHQフレームワークは、既存の最先端ハイブリッドクエリシステムと比較して顕著なパフォーマンス向上を達成できるか。
主な発見
- NHQフレームワークは、評価されたすべてのデータセットで、最先端の競合手法と同等の再現率を維持しながら、最大10倍の高速化を達成する。
- 提案されたNHQ-NPG_kgraphおよびNHQ-NPG_sprawl手法は、8つの公開および1つの社内実世界データセットにおいて、すべての既存システムを上回る性能を示す。
- 2つの新規NPGに実装された最適化されたエッジ選択およびルーティング戦略は、既存のPGと比較して、より優れた全体的なパフォーマンスを実現する。
- 共同プルーニングと複合インデックスの活用により、冗長な探索空間が削減され、精度を損なわず、クエリ効率が向上する。
- このフレームワークは、既存のPGと互換性があるため、さまざまなPGをハイブリッドクエリ処理に容易に統合できる。
- 学術的エキスパート検索システムにおける事例研究では、NHQ-NPG_kgraphがHNSWやVearchと比較して、特に属性制約が関与する状況でより正確で関連性の高いエキスパートを検索する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。