Skip to main content
QUICK REVIEW

[논문 리뷰] Exact Weighted Minwise Hashing in Constant Time

Anshumali Shrivastava|arXiv (Cornell University)|2016. 02. 26.
Advanced Image and Video Retrieval Techniques참고 문헌 20인용 수 7
한 줄 요약

이 논문은 O(k) 시간에 k개의 독립적이고 비편향된 해시를 계산하는 정확한 가중치 있는 미니웨이즈 해싱 알고리즘을 제안한다—비교적 Ioffe의 방법이 요구하는 O(dk) 시간보다 빠르며, 여기서 d는 비제로 원소의 수이다. 이 방법은 균일한 난수 변수와 비트 수준 연산에 기반한 새로운 해시 함수를 사용하여, 기존 방법의 64비트 대비 5–9비트의 해시 값만으로도 실제 데이터셋에서 최대 60,000배의 속도 향상을 이룩했으며, 자카르 유사도와 정확히 일치하는 충돌 확률을 유지한다.

ABSTRACT

Weighted minwise hashing (WMH) is one of the fundamental subroutine, required by many celebrated approximation algorithms, commonly adopted in industrial practice for large scale-search and learning. The resource bottleneck of the algorithms is the computation of multiple (typically a few hundreds to thousands) independent hashes of the data. The fastest hashing algorithm is by Ioffe \cite{Proc:Ioffe_ICDM10}, which requires one pass over the entire data vector, $O(d)$ ($d$ is the number of non-zeros), for computing one hash. However, the requirement of multiple hashes demands hundreds or thousands passes over the data. This is very costly for modern massive dataset. In this work, we break this expensive barrier and show an expected constant amortized time algorithm which computes $k$ independent and unbiased WMH in time $O(k)$ instead of $O(dk)$ required by Ioffe's method. Moreover, our proposal only needs a few bits (5 - 9 bits) of storage per hash value compared to around $64$ bits required by the state-of-art-methodologies. Experimental evaluations, on real datasets, show that for computing 500 WMH, our proposal can be 60000x faster than the Ioffe's method without losing any accuracy. Our method is also around 100x faster than approximate heuristics capitalizing on the efficient "densified" one permutation hashing schemes \cite{Proc:OneHashLSH_ICML14}. Given the simplicity of our approach and its significant advantages, we hope that it will replace existing implementations in practice.

연구 동기 및 목표

  • 대규모 데이터 응용 분야에서 다수의 독립적인 가중치 있는 미니웨이즈 해시를 생성하는 데 드는 높은 계산 비용을 해결하기 위해.
  • Ioffe의 정확한 방법이 고차원 희소 데이터를 여러 번 스캔해야 하는 O(dk) 시간 복잡도를 제거하기 위해.
  • 정확도를 훼손하지 않고도 해시 값 저장을 64비트에서 단지 5–9비트로 줄여 메모리 사용량을 감소시키기 위해.
  • 이론적으로 정확하고 실용적으로 효율적인 방법을 개발하여 빅데이터 시스템에서 널리 채택될 수 있도록 하기 위해.

제안 방법

  • 비제로 원소 각각을 균일한 난수 변수와 비트 수준 연산을 사용해 해시 값으로 매핑하는 새로운 해시 함수를 도입한다.
  • 두 단계 과정을 활용한다: 첫째, 각 비제로 원소에 균일 분포에서 생성된 난수 값을 할당하고, 둘째, 모든 원소들 사이에서 최소 해시 값을 계산한다.
  • 비트 수준의 자르기와 정규화를 사용하여 해시 값을 5–9비트로 압축하면서도 정확한 충돌 확률을 유지한다.
  • 이론적 경계를 유도하여 제안된 방법의 충돌 확률이 정확히 자카르 유사도와 일치함을 보여주며, 편향 없는 추정을 보장한다.
  • 독립적인 균일 분포 변수의 최솟값이 알려진 분포를 따르므로, 효율적이고 정확한 샘플링이 가능하다는 사실을 활용한다.
  • 다양한 해시 함수 간에 랜덤 값을 사전 계산하고 재사용하여, 평균적으로 상수 시간 복잡도를 달성한다.

실험 결과

연구 질문

  • RQ1가중치 있는 미니웨이즈 해싱이 데이터 희소성과 무관하게 해시당 상수 시간 내에 계산될 수 있는가?
  • RQ264비트에서 10비트 미만으로 해시 저장을 줄일 수 있으며, 정확한 충돌 확률을 유지할 수 있는가?
  • RQ3제안된 방법이 Ioffe의 O(dk) 방법보다 높은 속도 향상을 이룰 수 있으며, 편향을 유발하지 않는가?
  • RQ4실제로 제안된 방법의 정확도는 Ioffe의 정확한 방법과 근사 히우리스틱 방법과 비교해 어떻게 되는가?

주요 결과

  • 옥스포드 데이터셋에서 500개의 해시를 계산할 경우, 제안된 방법은 Ioffe의 방법보다 최대 60,000배 빠르며, 정확도는 동일하다.
  • 캘테크 101 데이터셋에서는 데이터 희소성에 따라 Ioffe의 방법보다 1,500배에서 70,000배 빠르게 작동한다.
  • 해시 값은 작은 범위 내에 압축되며(예: 웹이미지의 경우 [1,107] 범위), 해시당 7–9비트만 필요하여 메모리 사용량이 5–6배 감소한다.
  • 실험에서 관측된 평균 해시 값은 정리 2의 이론적 예측과 일치하여, 방법의 분포 정확성이 검증된다.
  • 자카르 유사도 추정의 정확도는 Ioffe의 정확한 방법과 구분되지 않으며, k=1에서 50개의 해시까지 평균 오차가 동일하게 유지된다.
  • 편향이 있는 근사 방법과 달리, Fast-WDOPH와 같은 근사 히우리스틱보다 5–100배 더 빠르게 작동하면서도 정확성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.