Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding and Improving Proximity Graph based Maximum Inner Product Search

Jie Liu, Yan Xiao|arXiv (Cornell University)|2019. 09. 30.
Data Management and Algorithms참고 문헌 23인용 수 5
한 줄 요약

이 논문은 최대 내적 곱 검색(MIPS)에서 높은 노름(norm)을 가진 항목들이 결과를 지배하는 강력한 노름 편향(norm bias)을 규명하며, ip-NSW의 뛰어난 성능이 고노름 항목들을 우선시하는 그래프 구조로 인해 이 편향이 증폭되기 때문에 발생함을 설명한다. 이를 보완하기 위해 저자는 내적 기반 검색 이전에 방향성이 유사한 항목을 찾는 각도 기반 근접성 그래프를 사용하는 ip-NSW+를 제안한다. 이는 불필요한 계산을 크게 줄이고 다양한 데이터 분포에서 ip-NSW를 능가하는 성능을 달성한다.

ABSTRACT

The inner-product navigable small world graph (ip-NSW) represents the state-of-the-art method for approximate maximum inner product search (MIPS) and it can achieve an order of magnitude speedup over the fastest baseline. However, to date it is still unclear where its exceptional performance comes from. In this paper, we show that there is a strong norm bias in the MIPS problem, which means that the large norm items are very likely to become the result of MIPS. Then we explain the good performance of ip-NSW as matching the norm bias of the MIPS problem - large norm items have big in-degrees in the ip-NSW proximity graph and a walk on the graph spends the majority of computation on these items, thus effectively avoids unnecessary computation on small norm items. Furthermore, we propose the ip-NSW+ algorithm, which improves ip-NSW by introducing an additional angular proximity graph. Search is first conducted on the angular graph to find the angular neighbors of a query and then the MIPS neighbors of these angular neighbors are used to initialize the candidate pool for search on the inner-product proximity graph. Experiment results show that ip-NSW+ consistently and significantly outperforms ip-NSW and provides more robust performance under different data distributions.

연구 동기 및 목표

  • ip-NSW가 이상적인 데라운데이 그래프의 근사치이지만 완벽하지 않은데도 불구하고 근사 MIPS에서 최고 성능을 내는 이유를 이해하는 것.
  • ip-NSW의 성능이 데이터 분포 및 노름 특성과의 상호작용에 의해 어떻게 영향을 받는지 규명하는 것.
  • 노름 분포가 비대칭일 경우 ip-NSW의 성능 저하 문제를 해결하기 위해 더 강인한 검색 전략을 설계하는 것.
  • 고노름이지만 관련성이 낮은 항목에 대한 불필요한 계산을 줄이면서도 높은 리콜을 유지하는 새로운 알고리즘을 개발하는 것.

제안 방법

  • 저자는 MIPS에서 강력한 노름 편향이 있음을 규명하고 정량화하며, 네 개의 데이터셋에서 상위 5% 노름 항목이 상위 10개 결과의 최대 100%를 차지함을 보여준다.
  • ip-NSW의 그래프 구조를 분석하여 고노름 항목이 유의미하게 높은 진입 차수(in-degree)를 가지며, 이로 인해 저노름 후보들을 생략하는 데에 효율적임을 입증한다.
  • 제안된 ip-NSW+는 먼저 쿼리와 방향이 유사한 항목을 찾기 위해 별도의 각도 기반 근접성 그래프를 도입한다.
  • 내적 기반 검색을 위한 후보 항목은 각도 기반 이웃들로부터 초기화되어 고노름이지만 관련성이 낮은 항목의 평가 수를 줄인다.
  • 이 알고리즘은 두 단계 검색을 수행한다: 먼저 각도 기반 그래프에서 유망한 후보를 찾고, 그 후보들을 기반으로 내적 기반 근접성 그래프에서 검색을 수행한다.
  • 노름 분포의 변화에 대해 강인함을 입증하기 위해, 다양한 尾部因자(TF)를 가진 데이터셋에서 일관된 성능을 보였다.

실험 결과

연구 질문

  • RQ1ip-NSW는 이상적인 데라운데이 그래프의 근사치이지만 완벽하지 않은데도 불구하고 근사 MIPS에서 왜 이렇게 높은 성능을 내는가?
  • RQ2ip-NSW의 성능은 데이터셋의 노름 분포에 얼마나 의존하는가?
  • RQ3ip-NSW의 노름 편향을 활용하거나 완화시켜 검색 효율성과 강인성을 향상시킬 수 있는가?
  • RQ4각도 유사성 정보를 통합하면 MIPS에서 더 나은 후보 선택과 계산 감소가 이루어지는가?

주요 결과

  • MIPS 문제에는 강력한 노름 편향이 존재한다: 네 개의 데이터셋에서 상위 5% 노름 항목이 노름 분포가 비대칭이 아니어도 상위 10개 결과의 87.5%에서 100%까지 차지함을 확인했다.
  • ip-NSW의 성능은 고노름 항목이 높은 진입 차수를 가지며, 이로 인해 보행이 가장 가능성 있는 후보들에 집중됨을 설명하는 그래프 구조에 기인한다.
  • ip-NSW+는 리콜 당 유사도 함수 평가 수 측면에서 ip-NSW를 뛰어넘는 성능을 보이며, 특히 노름 분포가 다양할 경우 두드러진다.
  • ip-NSW+는 노름 분포가 다른 ImageNet 변종( TF 2.05에서 1.37)에서도 일관된 성능을 유지하지만, ip-NSW는 노름 비대칭성이 증가함에 따라 성능이 저하됨을 확인했다.
  • 각도 그래프의 $M$ 및 $l$ 파라미터 선택에 대해 ip-NSW+의 성능은 강인하며, 최적 성능은 $M=10$, $l=10$에서 달성된다.
  • 후보 풀을 각도 이웃으로 초기화함으로써 내적 평가가 높은 잠재력을 가진 항목들에 집중되어 불필요한 계산이 줄어든다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.