Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Cross-Modal Retrieval via Deep Binary Hashing and Quantization

Yang Shi, Youngjoo Chung|arXiv (Cornell University)|2022. 02. 15.
Advanced Image and Video Retrieval Techniques인용 수 4
한 줄 요약

이 논문은 효율적인 다중모odal 검색을 위한 딥러닝 프레임워크인 HQ를 제안한다. 이는 이진 해시 코드와 양자화 코드를 동시에 학습함으로써, 이중 단계 검색(이진 코드의 해밍 거리로 후보를 필터링하고, 이후 양자화 거리로 재순서 정렬)을 통해 기존의 순수 양자화 방법 대비 O(n)의 속도 향상을 유지하면서도 최신 기술 대비 7퍼센트 이상 높은 정밀도를 달성한다.

ABSTRACT

Cross-modal retrieval aims to search for data with similar semantic meanings across different content modalities. However, cross-modal retrieval requires huge amounts of storage and retrieval time since it needs to process data in multiple modalities. Existing works focused on learning single-source compact features such as binary hash codes that preserve similarities between different modalities. In this work, we propose a jointly learned deep hashing and quantization network (HQ) for cross-modal retrieval. We simultaneously learn binary hash codes and quantization codes to preserve semantic information in multiple modalities by an end-to-end deep learning architecture. At the retrieval step, binary hashing is used to retrieve a subset of items from the search space, then quantization is used to re-rank the retrieved items. We theoretically and empirically show that this two-stage retrieval approach provides faster retrieval results while preserving accuracy. Experimental results on the NUS-WIDE, MIR-Flickr, and Amazon datasets demonstrate that HQ achieves boosts of more than 7% in precision compared to supervised neural network-based compact coding models.

연구 동기 및 목표

  • 이미지, 텍스트, 오디오와 같은 다양한 모odal 간의 다중모달 검색에서 높은 저장소 및 계산 비용을 해결하기 위해.
  • 이진 해싱(빠르지만 정확도가 낮음)과 양자화(정확도는 높지만 느림)의 단일 코드 방법의 한계를 극복하기 위해 두 코드를 동시에 학습함으로써.
  • 이진 해싱을 통한 빠른 후보 필터링과 양자화를 통한 정확한 재순서 정렬을 활용하는 이중 단계 검색 파이프라인을 설계하기 위해.
  • 두 가지 압축 코드의 엔드 투 엔드 학습을 통해 더 높은 검색 정확도를 달성하면서도 계산 비용을 감소시키기 위해.
  • 이중 해시 및 양자화 코드의 동시에 학습이 순차적 또는 정규화된 대안보다 성능을 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 다중모달 데이터를 위한 이중 해시 코드와 양자화 코드를 동시에 최적화하는 엔드 투 엔드 딥 네트워크를 제안한다.
  • 검색 공간을 크게 줄이기 위해 첫 번째 단계의 필터링으로 이진 코드 간의 해밍 거리를 사용한다.
  • 두 번째 단계에서 필터링된 후보들을 재순서 정렬하기 위해 양자화 거리(예: 양자화된 벡터와 딕셔너리 항목 간의 L1 또는 L2 노름)를 적용한다.
  • 공유된 특징 인코더와 공유된 손실 함수를 통해 두 코드 유형을 통합하여 다중모달 의미적 유사성을 유지한다.
  • 각 데이터 포인트가 가장 가까운 딕셔너리 항목을 나타내는 이진 코드를 할당하는 가속 가능한 딕셔너리(코드북)를 활용한다.
  • 모델은 대비 손실을 통해 엔드 투 엔드로 학습되며, 이는 서로 의미적으로 유사한 샘플이 다양한 모달 간에 유사한 코드를 가지도록 유도한다.

실험 결과

연구 질문

  • RQ1이진 해시 코드와 양자화 코드를 동시에 학습하는 것이 단독으로 하나의 코드 유형을 사용하는 것보다 다중모달 검색 정확도를 향상시킬 수 있는가?
  • RQ2이중 해시로 필터링하고 양자화로 재순서 정렬하는 이중 단계 검색 파이프라인은 단일 단계 방법에 비해 더 나은 속도-정확도 트레이드오프를 달성하는가?
  • RQ3두 코드를 동시에 학습하는 것이 각각 별도로 학습하거나 정규화를 통해 분리하여 학습하는 것보다 성능이 뛰어난가?
  • RQ4이진 해시로 검색하는 후보 수의 비율(α)을 어느 정도로 설정할 경우 정확도와 속도 사이의 최적 균형을 이룰 수 있는가?
  • RQ5기존의 양자화 기반 모델 대비 HQ 프레임워크가 검색 시간을 얼마나 줄이며, 정확도를 유지하거나 향상시키는가?

주요 결과

  • NUS-WIDE, MIR-Flickr, Amazon 데이터셋에서 HQ는 감독 기반 신경망 기반의 압축 코딩 모델 대비 평균 평균 정밀도(MAP@50)에서 7퍼센트 이상의 정밀도 향상을 달성한다.
  • 이중 해시로 필터링하고 이후 양자화로 재순서 정렬하는 이중 단계 검색 전략은 단독으로 이진 코드나 양자화 코드를 사용하는 것보다 더 높은 정확도를 달성한다.
  • α(이진 해시로 검색하는 후보 비율)가 0.1–0.3 또는 0.6–0.8로 설정될 경우, 정확도와 속도 사이의 최적 균형을 달성한다.
  • HQ의 검색 시간은 입력 특징 차원 수 n에 대해 선형적으로 증가하며, 순수 양자화 방법(CDQ) 대비 동일한 메모리 사용량과 정확도를 유지하면서도 O(n)의 속도 향상을 달성한다.
  • 이중 해시 및 양자화 코드를 동시에 학습하는 것이 별도로 학습하는 것(C+D 모델 등)보다 성능이 뛰어나, 두 코드 유형 간 정보 공유가 더 효과적임을 보여준다.
  • L1 또는 L2 정규화를 적용한 양자화 기반 모델은 HQ에 비해 성능이 열등하여, 정규화를 통한 코드 상호작용의 대체 수단으로서의 효과가 떨어지고, 공동 최적화가 더 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.