Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning

Rong-Cheng Tu, Xian-Ling Mao|arXiv (Cornell University)|2019. 07. 29.
Advanced Image and Video Retrieval Techniques참고 문헌 39인용 수 5
한 줄 요약

이 논문은 데이터베이스의 이미지-텍스트 쌍에 대해 통합 해시 코드를 공동으로 학습하고, 미리 보지 않은 쿼리에 대해 모ality별 해시 함수를 학습하는 새로운 엔드 투 엔드 딥 크로스모달 해싱 방법인 DCHUC을 제안한다. 양방향 피드백을 통해 두 구성 요소를 반복적으로 최적화함으로써, DCHUC은 세 가지 공개 데이터셋에서 빠른 훈련 속도와 하이퍼파라미터 선택에 대한 강건성을 확보하면서 최신 기술 수준의 검색 성능을 달성한다.

ABSTRACT

Due to their high retrieval efficiency and low storage cost, cross-modal hashing methods have attracted considerable attention. Generally, compared with shallow cross-modal hashing methods, deep cross-modal hashing methods can achieve a more satisfactory performance by integrating feature learning and hash codes optimizing into a same framework. However, most existing deep cross-modal hashing methods either cannot learn a unified hash code for the two correlated data-points of different modalities in a database instance or cannot guide the learning of unified hash codes by the feedback of hashing function learning procedure, to enhance the retrieval accuracy. To address the issues above, in this paper, we propose a novel end-to-end Deep Cross-Modal Hashing with Hashing Functions and Unified Hash Codes Jointly Learning (DCHUC). Specifically, by an iterative optimization algorithm, DCHUC jointly learns unified hash codes for image-text pairs in a database and a pair of hash functions for unseen query image-text pairs. With the iterative optimization algorithm, the learned unified hash codes can be used to guide the hashing function learning procedure; Meanwhile, the learned hashing functions can feedback to guide the unified hash codes optimizing procedure. Extensive experiments on three public datasets demonstrate that the proposed method outperforms the state-of-the-art cross-modal hashing methods.

연구 동기 및 목표

  • 데이터베이스 내 관련된 이미지-텍스트 쌍에 대해 기존의 딥 크로스모달 해싱 방법들이 통합 해시 코드를 학습하지 못하는 한계를 해결한다.
  • 이전 방법에서 통합 해시 코드 학습과 해시 함수 최적화 간 이중 방향 피드백의 부족을 보완한다.
  • 통합 해시 코드와 모달리티별 해시 함수를 공동으로 최적화하는 엔드 투 엔드 프레임워크를 개발하여 검색 정확도를 향상시킨다.
  • ADSH에서 영감을 얻은 비대칭 샘플링 기반 전략을 통해 대규모 데이터베이스의 훈련 시간 복잡도를 감소시킨다.
  • 핵심 파라미터에 대한 광범위한 민감도 분 析을 통해 하이퍼파라미터 변동에 대한 강건성을 확보한다.

제안 방법

  • 데이터베이스 인스턴스에 대한 통합 해시 코드와 새로운 쿼리에 대한 해시 함수를 번갈아가며 정밀하게 개선하는 반복 최적화 알고리즘을 제안한다.
  • 해시 손실(상호 및 내부 모달 유사성 유지)과 분류 손실(의미적 분류 능력 향상)을 결합한 공동 목적 함수를 도입한다.
  • 비대칭 샘플링 전략을 사용: n개의 데이터베이스 인스턴스에서 m개의 앵커 인스턴스를 선택함(m ≪ n)으로써 훈련 복잡도를 O(mn)으로 감소시킨다.
  • 비대칭 유사도 행렬을 구성하여 해시 함수 학습과 통합 해시 코드 최적화를 동시에 지도한다.
  • 통합 해시 코드가 해시 함수 학습을 안내하고, 해시 함수가 다시 통합 코드를 개선하는 피드백을 제공하는 엔드 투 엔드 훈련 파이프라인을 구현한다.
  • 전체 네트워크를 통해 역전파를 적용하여 단일 프레임워크 내에서 모든 파라미터를 공동 최적화한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 딥 해싱 프레임워크에서 데이터베이스 내 이미지-텍스트 쌍에 대한 통합 해시 코드를 효과적으로 학습할 수 있는가?
  • RQ2학습된 해시 함수에서 온 피드백이 통합 해시 코드 최적화의 품질을 향상시키는가?
  • RQ3제안된 방법이 최신 기술 수준의 크로스모달 해싱 기반 방법보다 더 높은 검색 정확도를 달성할 수 있는가?
  • RQ4비대칭 샘플링 전략은 검색 성능을 희생시키지 않고 훈련 효율성에 어떤 영향을 미치는가?
  • RQ5실제 적용에서 제안된 방법은 하이퍼파라미터 설정에 얼마나 민감한가?

주요 결과

  • DCHUC은 세 가지 공개 데이터셋(MIRFLICKR-25K, IAPR TC-12, NUS-WIDE)에서 최신 기술 수준의 성능을 달성하여 I2T 및 T2I 검색 작업 모두에서 기존 방법을 능가한다.
  • NUS-WIDE 데이터셋에서 DCHUC은 최신 기술 수준의 방법인 SSAH보다 더 높은 검색 성능을 보였으며, 특히 평균 평균 정밀도(MAP) 측면에서 뛰어난 성능을 나타냈다.
  • 목적 함수는 10회 이내에 수렴하며, I→T 및 T→I 검색 작업의 MAP 값이 목적 함수 값 감소와 함께 안정화되고 향상된다.
  • DCHUC은 SSAH 및 DCMH보다 훨씬 빠른 훈련 속도를 보였으며, IAPR TC-12, MIRFLICKR-25K, NUS-WIDE(32비트 코드)에서 각각 11.8초, 12.9초, 28.2초의 훈련 시간을 기록했고, CMDVH는 각각 16.3초, 21.2초, 39.2초였다.
  • 이 방법은 하이퍼파라미터 변동에 강건하다: α, γ, η(1–600), β(10⁻³–10), μ(1–600)의 넓은 범위에서 높은 성능과 안정적인 MAP 값을 유지한다.
  • 정밀도-재현율 분석에서 DCHUC은 높은 재현율(예: 0.9)에서도 높은 정밀도를 유지하며, MIRFLICKR-25K 및 NUS-WIDE에서 기준 방법들을 능가하여 해밍 공간 내 유사 쌍의 밀도가 더 높다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.