Skip to main content
QUICK REVIEW

[논문 리뷰] Practical Hash Functions for Similarity Estimation and Dimensionality Reduction

Søren Dahlgaard, Mathias Bæk Tejs Knudsen|arXiv (Cornell University)|2017. 11. 23.
Advanced Image and Video Retrieval Techniques참고 문헌 4인용 수 10
한 줄 요약

이 논문은 유사도 추정과 특징 해싱에서 일반적으로 사용되는 해시 함수의 실용적이고 증명 가능하게 좋은 대안으로 혼합 탭룰레이션 해싱을 평가한다. 이는 이론적 농도 경계와 실제 실험에서 진정으로 랜덤 해싱과 유사한 성능을 보이며, 다중-모듈로-프라임과 머머해시3보다 신뢰성과 속도에서 뛰어나며, 머머해시3보다 40% 빠른 성능을 보인다. 이는 강력한 이론적 보장을 제공한다.

ABSTRACT

Hashing is a basic tool for dimensionality reduction employed in several aspects of machine learning. However, the perfomance analysis is often carried out under the abstract assumption that a truly random unit cost hash function is used, without concern for which concrete hash function is employed. The concrete hash function may work fine on sufficiently random input. The question is if it can be trusted in the real world when faced with more structured input. In this paper we focus on two prominent applications of hashing, namely similarity estimation with the one permutation hashing (OPH) scheme of Li et al. [NIPS'12] and feature hashing (FH) of Weinberger et al. [ICML'09], both of which have found numerous applications, i.e. in approximate near-neighbour search with LSH and large-scale classification with SVM. We consider mixed tabulation hashing of Dahlgaard et al.[FOCS'15] which was proved to perform like a truly random hash function in many applications, including OPH. Here we first show improved concentration bounds for FH with truly random hashing and then argue that mixed tabulation performs similar for sparse input. Our main contribution, however, is an experimental comparison of different hashing schemes when used inside FH, OPH, and LSH. We find that mixed tabulation hashing is almost as fast as the multiply-mod-prime scheme ax+b mod p. Mutiply-mod-prime is guaranteed to work well on sufficiently random data, but we demonstrate that in the above applications, it can lead to bias and poor concentration on both real-world and synthetic data. We also compare with the popular MurmurHash3, which has no proven guarantees. Mixed tabulation and MurmurHash3 both perform similar to truly random hashing in our experiments. However, mixed tabulation is 40% faster than MurmurHash3, and it has the proven guarantee of good performance on all possible input.

연구 동기 및 목표

  • 유사도 추정과 특징 해싱을 포함한 실세계 기계학습 워크로드에서 혼합 탭룰레이션 해싱의 실용적 성능을 평가하기 위해.
  • 다양하게 사용되는 해시 함수인 다중-모듈로-프라임과 머머해시3가 실생활에서 편향이나 열악한 농도 경계를 유발하는지 평가하기 위해.
  • 속도, 정확도, 이론적 보장 측면에서 혼합 탭룰레이션 해싱을 다른 해시 함수들과 비교하기 위해.
  • OPH와 FH와 같은 응용 분야에서 진정으로 랜덤 해싱과 거의 동일한 성능을 보이는 혼합 탭룰레이션 해싱의 경험적 및 이론적 증거를 제공하기 위해.
  • 빠름, 신뢰성, 증명 가능한 성능의 조합으로 인해 실무에서의 선호 기준으로 혼합 탭룰레이션을 주장하기 위해.

제안 방법

  • 저자는 한 번의 순열 해싱(OPH)과 특징 해싱(FH)이라는 두 핵심 응용 분야에서 혼합 탭룰레이션 해싱을 구현하고 평가한다.
  • 합성 데이터, MNIST, News20 데이터셋을 대상으로 LSH 기반의 유사도 검색에서 범위 농도와 검색 품질을 측정하기 위해 광범위한 실험을 수행한다.
  • 특징 해싱의 경우, 100회의 반복 동안 변환된 벡터의 제곱 L2 노름을 계산하여 분산과 편향을 평가한다.
  • OPH를 사용한 LSH의 경우, K와 L 값이 다양한 조건에서의 #검색된 / 재현율 비율을 측정하며, 명확성을 위해 K=L=10을 중심으로 분석한다.
  • 속도와 정확도 측면에서 혼합 탭룰레이션을 다중-모듈로-프라임, 2-웨이 폴리해싱, 머머해시3, 시티해시와 비교한다.
  • 진정으로 랜덤 해싱 하에서 FH에 대한 향상된 농도 경계를 유도하고, 입력 벡터가 희박한 경우 혼합 탭룰레이션이 유사한 성능을 달성함을 보여준다.

실험 결과

연구 질문

  • RQ1혼합 탭룰레이션 해싱은 OPH와 FH와 같은 실생활 응용에서 진정으로 랜덤 해싱과 동일한 성능을 보이는가?
  • RQ2다양하게 사용되는 해시 함수인 다중-모듈로-프라임과 머머해시3는 실세계 데이터에서 체계적인 편향이나 열악한 농도 경계를 초래하는가?
  • RQ3유사도 추정과 차원 축소에서 혼합 탭룰레이션은 머머해시3와 시티해시보다 속도와 정확도 측면에서 어떻게 비교되는가?
  • RQ4혼합 탭룰레이션의 이론적 보장이 다양한 데이터 분포에 걸쳐 실생활의 강건성으로 얼마나 잘 전이되는가?
  • RQ5혼합 탭룰레이션은 기계학습 파이프라인에서 히우리스틱 해시 함수의 신뢰할 수 있고 효율적인 대안인가?

주요 결과

  • 혼합 탭룰레이션 해싱은 범위 농도와 LSH 재현율 모두에서 진정으로 랜덤 해싱과 거의 동일한 성능을 보이며, 최소한의 편향과 뛰어난 농도 경계를 확보한다.
  • 다중-모듈로-프라임 해싱은 특히 구조화되거나 실세계 데이터에서 상호 유사도의 과대평가와 열악한 농도 경계를 야기하며, 빠르지만 심각한 문제를 일으킨다.
  • 머머해시3는 실생활에서 진정으로 랜덤 해싱과 유사한 성능을 보이지만 이론적 보장이 없어, 악의적인 또는 구조화된 입력에서 더 신뢰성이 떨어진다.
  • 혼합 탭룰레이션 해싱는 머머해시3보다 40% 더 빠르며, 실측 성능을 그대로 유지하므로 실무에서 더 낫다.
  • MNIST 데이터셋에서 2-웨이 폴리해싱은 노름을 16.671로 산출했지만, 혼합 탭룰레이션은 단지 2.077로 나타내어 약한 해시 함수에서 심각한 편향을 보였다.
  • #검색된 / 재현율 비율 지표는 다중-모듈로-프라임이 약간 더 높은 재현율을 보였지만, 과다 검색으로 인해 일관되게 성능이 열 劣하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.