Skip to main content
QUICK REVIEW

[논문 리뷰] Application-Driven Near-Data Processing for Similarity Search

Vincent T. Lee, Amrita Mazumdar|arXiv (Cornell University)|2016. 06. 12.
Advanced Image and Video Retrieval Techniques참고 문헌 87인용 수 4
한 줄 요약

이 논문은 유사도 검색을 위해 메모리 내에서 k-가 б가운접근(KNN) 계산을 직접 수행하는 Hybrid Memory Cube(HMC)와 통합된 near-data processing 가속기인 SSAM을 제안한다. DRAM과 처리 단위를 공유하고 데이터 병렬 거리 계산 및 상위-k 정렬 최적화를 통해, SSAM은 CPU, GPU, FPGA보다 면적 기준 최대 100배 높은 처리량과 에너지 효율성을 달성한다. 또한 효율적인 KNN 색인 구축 기능을 제공하며, 높은 용량의 콘텐츠 기반 메모리로도 기능할 수 있다.

ABSTRACT

Similarity search is a key to a variety of applications including content-based search for images and video, recommendation systems, data deduplication, natural language processing, computer vision, databases, computational biology, and computer graphics. At its core, similarity search manifests as k-nearest neighbors (kNN), a computationally simple primitive consisting of highly parallel distance calculations and a global top-k sort. However, kNN is poorly supported by today's architectures because of its high memory bandwidth requirements. This paper proposes an application-driven near-data processing accelerator for similarity search: the Similarity Search Associative Memory (SSAM). By instantiating compute units close to memory, SSAM benefits from the higher memory bandwidth and density exposed by emerging memory technologies. We evaluate the SSAM design down to layout on top of the Micron hybrid memory cube (HMC), and show that SSAM can achieve up to two orders of magnitude area-normalized throughput and energy efficiency improvement over multicore CPUs; we also show SSAM is faster and more energy efficient than competing GPUs and FPGAs. Finally, we show that SSAM is also useful for other data intensive tasks like kNN index construction, and can be generalized to semantically function as a high capacity content addressable memory.

연구 동기 및 목표

  • 유사도 검색 워크로드에서 증가하는 메모리 대역폭의 한계를 해결하기 위해.
  • 근접 데이터 처리를 통해 kNN 검색에서의 데이터 이동 오버헤드를 줄이기 위해.
  • HMC와 같은 신개념 3D 스택드 메모리 기술을 활용하여 kNN 워크로드에 특화된 애플리케이션 기반 가속기를 설계하기 위해.
  • 유사도 검색 및 관련 작업에서 전통적인 CPU, GPU, FPGA에 비해 뚜렷한 성능 및 에너지 효율성 향상을 입증하기 위해.
  • 가속기의 일반화를 탐색하여 데이터 집약적 워크로드를 위한 고용량 콘텐츠 기반 메모리로 기능할 수 있도록 하기 위해.

제안 방법

  • die-stacked HMC 내부에 통합된 프로그래머블 벡터 프로세서 기반 가속기를 설계하여 메모리 내에서 kNN 연산을 직접 수행하기 위해.
  • 데이터 이동을 최소화하기 위해 병렬 거리 계산을 위한 하드웨어 지원과 글로벌 상위-k 선택을 위한 우선순위 큐를 구현하기 위해.
  • 벡터 내적 및 비교 지시어와 같은 유사도 검색을 위한 특수 지시어를 포함하여 지시어 세트를 확장하기 위해.
  • 정확한 성능 및 면적 추정을 위해 물리적 레이아웃까지의 설계 합성 및 시뮬레이션을 수행하기 위해.
  • 실제 kNN 워크로드와 색인 작업을 대상으로 CPU, GPU, FPGA와의 성능 비교 평가를 수행하기 위해.
  • 고성능 메모리 대역폭과 밀도를 제공하는 HMC와 같은 신개념 메모리 기술을 활용하여 효율적인 메모리 내 연산을 가능하게 하기 위해.

실험 결과

연구 질문

  • RQ1근접 데이터 처리가 kNN 유사도 검색에서 데이터 이동 오버헤드를 상당히 줄여 성능 및 에너지 효율성 향상에 기여할 수 있는가?
  • RQ2kNN 워크로드에 공동 최적화된 애플리케이션 기반 가속기 설계는 GPU 및 FPGA와 같은 일반 목적 가속기와 비교해 어떻게 성능을 냅니다?
  • RQ3벡터 프로세서를 활용한 메모리 내 처리가 대규모 데이터셋에서 kNN 쿼리의 지연 시간과 에너지 비용을 얼마나 줄일 수 있는가?
  • RQ4동일한 가속기 아키텍처가 KNN 색인 구축과 같은 관련 데이터 집약적 작업에도 재사용 가능한가?
  • RQ5SSAM 설계가 고용량 콘텐츠 기반 메모리로 기능할 수 있는가, 이는 kNN을 초월한 연관 검색을 가능하게 하는가?

주요 결과

  • SSAM은 다중 코어 CPU 대비 면적 기준 최대 100배 높은 처리량을 달성한다.
  • SSAM은 유사도 검색 워크로드에서 다중 코어 CPU 대비 최대 100배 높은 에너지 효율성을 제공한다.
  • SSAM은 kNN 검색에서 처리량과 에너지 효율성 양면에서 GPU 및 FPGA를 모두 능가한다.
  • 벡터 처리 중 데이터 이동을 줄임으로써 SSAM 설계는 효율적인 KNN 색인 구축을 가능하게 한다.
  • SSAM은 일반화되어 고용량 콘텐츠 기반 메모리로 기능할 수 있으며, kNN을 초월한 의미적 유연성을 입증한다.
  • 하드웨어와 지시어 세트 확장의 애플리케이션 기반 공동 설계가 kNN의 계산 패tern과 정확히 일치함으로써 뚜렷한 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.