Skip to main content
QUICK REVIEW

[論文レビュー] Results of the NeurIPS'21 Challenge on Billion-Scale Approximate Nearest Neighbor Search

Harsha Vardhan Simhadri, George Williams|arXiv (Cornell University)|May 8, 2022
Advanced Image and Video Retrieval Techniques参考文献 29被引用数 14
ひとこと要約

本論文は、NeurIPS'21における10億スケール近似最近傍(ANNS)探索のチャレンジの結果を提示する。6つの大規模データセットを用いて、標準的なDRAM制限型、DRAM+SSD、カスタムハードウェアの3つのハードウェアトラックでアルゴリズムを評価した。最適化されたグラフベースおよびマルチGPUアプローチが、10億スケールでベースラインを上回り、コストおよび消費電力効率が向上していることを示した。OptaNNE GraphNNとCUANNS MultiGPUが、それぞれリ콜とスループットで最高のパフォーマンスを達成した。

ABSTRACT

Despite the broad range of algorithms for Approximate Nearest Neighbor Search, most empirical evaluations of algorithms have focused on smaller datasets, typically of 1 million points~\citep{Benchmark}. However, deploying recent advances in embedding based techniques for search, recommendation and ranking at scale require ANNS indices at billion, trillion or larger scale. Barring a few recent papers, there is limited consensus on which algorithms are effective at this scale vis-à-vis their hardware cost. This competition compares ANNS algorithms at billion-scale by hardware cost, accuracy and performance. We set up an open source evaluation framework and leaderboards for both standardized and specialized hardware. The competition involves three tracks. The standard hardware track T1 evaluates algorithms on an Azure VM with limited DRAM, often the bottleneck in serving billion-scale indices, where the embedding data can be hundreds of GigaBytes in size. It uses FAISS~\citep{Faiss17} as the baseline. The standard hardware track T2 additional allows inexpensive SSDs in addition to the limited DRAM and uses DiskANN~\citep{DiskANN19} as the baseline. The specialized hardware track T3 allows any hardware configuration, and again uses FAISS as the baseline. We compiled six diverse billion-scale datasets, four newly released for this competition, that span a variety of modalities, data types, dimensions, deep learning models, distance functions and sources. The outcome of the competition was ranked leaderboards of algorithms in each track based on recall at a query throughput threshold. Additionally, for track T3, separate leaderboards were created based on recall as well as cost-normalized and power-normalized query throughput.

研究の動機と目的

  • 10億スケールのデータセットにおけるANNSアルゴリズムのパフォーマンスを、現実的なハードウェア制約のもとで評価すること。
  • 大規模ANNSシステムの再現可能でオープンソースのベンチマーキングフレームワークを確立すること。
  • メモリ、ストレージ、GPU使用の異なるハードウェア構成におけるアルゴリズム効率の比較。
  • 検索、推薦、ランク付けなどの実世界の応用に適したスケーラブルでコスト効率の良いソリューションの同定。
  • 大規模ベクトル検索におけるシステムおよびアルゴリズム設計のイノベーションを促進すること。

提案手法

  • チャレンジはGitHub上でホストされた標準化された評価フレームワークを用い、ANNS実装の再現可能なベンチマーキングを可能にした。
  • 3つのハードウェアトラックを定義した:T1(64GB DRAMのみ)、T2(64GB DRAM + SSD)、T3(カスタムハードウェア)、それぞれ異なるリソース制約を有する。
  • Microsoft、Meta、Baidu、Yandexから新規リリースを含む6つの多様な10億スケールデータセットを収集した。複数のモダリティおよび埋め込みタイプをカバーする。
  • k-NNおよび範囲検索クエリに対して、固定k=10および半径Rを用い、最小クエリスループットしきい値でのリコールを評価した。
  • T3では、効率性を評価するため、リコール、コスト正規化スループット、電力正規化スループットに基づく追加のリーダーボードを作成した。
  • ベースラインシステムにはFAISS(T1、T3)とDiskANN(T2)が含まれ、すべてのデータセットで標準化された指標を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1どのANNSアルゴリズムが、ハードウェアコストを最小限に抑えながら10億スケールで最高のリコールを達成するか?
  • RQ2DRAM、SSD、GPUなどの異なるハードウェア構成が、ANNSシステムのパフォーマンスおよび効率にどのように影響するか?
  • RQ3グラフベースまたはマルチGPUアプローチが、スケール上で従来のベクトル量子化や木構造ベースの手法を上回ることができるか?
  • RQ4アルゴリズム設計が、大規模ANNSワークロードにおけるスループットおよびエネルギー効率にどのように影響するか?
  • RQ5実世界の展開状況において、精度、遅延、コストのトレードオフは何か?

主な発見

  • OptaNNE GraphNNは、特化型ハードウェアトラック(T3)で最高のリコールを達成し、コスト正規化および電力正規化スループットのリーダーボードで1位となった。
  • CUANNS MultiGPUはT3で最高のクエリスループットを達成し、大規模ANNSにおけるマルチGPU加速の有効性を示した。
  • ベースラインのFAISS実装は、すべてのトラックで複数の提出物に上回られ、スケーラブルなANNSシステムにおける改善の余地が大きいことを示した。
  • T2におけるSSDの使用は、T1に比べて顕著にパフォーマンスを向上させ、DRAMが不足している場合にストレージI/Oが重要なボトルネックとなることを示した。
  • 評価フレームワークは、多様なデータセットおよびハードウェア間での再現可能なベンチマーキングを成功裏に実現し、複数の提出物による結果の検証が行われた。
  • IntelとNVIDIAは、複数の指標において優れたパフォーマンスを発揮したOptaNNE GraphNNおよびCUANNS MultiGPUを背景に、チャレンジの共同優勝者として名前を上げた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。