Skip to main content
QUICK REVIEW

[논문 리뷰] Ranking-based Deep Cross-modal Hashing

Xuanwu Liu, Guoxian Yu|arXiv (Cornell University)|2019. 05. 11.
Advanced Image and Video Retrieval Techniques참고 문헌 24인용 수 4
한 줄 요약

이 논문은 교차 모달 검색 성능을 햖थ기 위해 준감독형 의미 순서 정렬과 딥 특징 학습을 통합하는 새로운 방법인 순위 기반 딥 교차 모달 해싱(RDCMH)을 제안한다. 적응형 트리플릿 순서 정렬 손실을 사용해 딥 특징과 해싱 함수를 함께 최적화함으로써, RDCMH는 레이블이 제한된 조건에서도 최신 기술(SOTA) 수준의 성능을 달성한다.

ABSTRACT

Cross-modal hashing has been receiving increasing interests for its low storage cost and fast query speed in multi-modal data retrievals. However, most existing hashing methods are based on hand-crafted or raw level features of objects, which may not be optimally compatible with the coding process. Besides, these hashing methods are mainly designed to handle simple pairwise similarity. The complex multilevel ranking semantic structure of instances associated with multiple labels has not been well explored yet. In this paper, we propose a ranking-based deep cross-modal hashing approach (RDCMH). RDCMH firstly uses the feature and label information of data to derive a semi-supervised semantic ranking list. Next, to expand the semantic representation power of hand-crafted features, RDCMH integrates the semantic ranking information into deep cross-modal hashing and jointly optimizes the compatible parameters of deep feature representations and of hashing functions. Experiments on real multi-modal datasets show that RDCMH outperforms other competitive baselines and achieves the state-of-the-art performance in cross-modal retrieval applications.

연구 동기 및 목표

  • 기존 교차 모달 해싱 방법이 쌍별 유사도와 원시/수작업 특징에 의존하는 데서 비롯하는 한계를 해결하기 위해.
  • 다중 레이블 데이터로부터 복잡한 다수준 순서 정렬 의미를 활용하여 검색 성능을 향상시키기 위해.
  • 준감독형 의미 측정을 통해 레이블이 있는 데이터와 없는 데이터를 통합하여 해싱 성능을 향상시키기 위해.
  • 더 나은 호환성과 표현을 위해 딥 특징 학습과 해싱 함수 학습을 함께 최적화하기 위해.
  • 완전한 레이블 세트에 의존하는 것을 줄여 약한 감독 설정에서의 강인성을 확보하기 위해.

제안 방법

  • RDCMH는 특징과 레이블 정보를 모두 사용해 다수준 유사도를 포괄하는 준감독형 의미 순서 정렬 목록을 구성한다.
  • 의미 유사도에 기반해 더 관련성이 높은 인스턴스 쌍에 더 높은 가중치를 할당하는 적응형 트리플릿 순서 정렬 손실을 도입한다.
  • 통합 목표 함수를 사용해 특징 추출을 위한 딥 신경망 파라미터와 해싱 함수를 함께 최적화한다.
  • 레이블과 특징에 기반한 유사도 행렬 S를 사용해 순서 정렬 목록 구축을 안내함으로써 의미 표현을 향상시킨다.
  • 엔드 투 엔드 방식으로 딥 특징 학습과 해싱 최적화를 통합하여 특징과 이진 코드 간의 호환성을 향상시킨다.
  • 학습 중 정량화 손실과 순서 정렬 손실을 균형 잡기 위해 스칼라 하이퍼파라미터 λ를 사용한다.

실험 결과

연구 질문

  • RQ1다양한 수준의 의미적 구조를 포착하는 순위 기반 접근 방식이 쌍별 유사도를 넘어서 교차 모달 해싱 성능을 향상시킬 수 있는가?
  • RQ2레이블이 불완전할 경우, 비레이블 데이터를 효과적으로 활용해 해싱 성능을 향상시킬 수 있는가?
  • RQ3딥 특징과 해싱 코드의 공동 최적화가 별도 학습보다 더 높은 검색 정확도를 이끌 수 있는가?
  • RQ4제안된 방법은 하이퍼파라미터 선택, 특히 λ에 대해 얼마나 민감한가?
  • RQ5레이블 누락이 있는 약한 감독 설정에서도 성능을 유지할 수 있는가?

주요 결과

  • RDCMH는 Mirflickr, NUS-WIDE, Wiki와 같은 세 가지 벤치마크 다중 모달 데이터셋에서 최신 기술(SOTA) 성능을 달성하며, 모든 경쟁 기반 방법을 능가한다.
  • Wiki 데이터셋에서 RDCMH는 SePH보다 더 높은 MAP 값을 기록하여 교차 모달 검색에서 뛰어난 성능을 입증한다.
  • 레이블의 30%가 마스킹된 조건에서도 RDCMH는 두 번째로 좋은 방법(CDQ)보다 평균 MAP에서 4% 높은 성능을 유지하여 레이블 부족에 대한 강인성을 입증한다.
  • 레이블 가용성이 10%일 경우 RDCMH의 MAP는 70.2%로 떨어졌고, 두 번째로 좋은 방법(CHN)의 81.9%보다 낮게 유지되어, 약한 감독 설정에서의 효과성을 확인한다.
  • 제거 분석 결과, RDCMH-NW(적응형 가중치)는 RDCMH-NW(균일 가중치)보다 성능이 뛰어나, 가중 트리플릿 순서 정렬의 유용성을 입증한다.
  • 딥 특징 학습이 없는 변형(RDCMH-ND)과 공동 최적화가 없는 변형(RDCMH-NJ)보다 RDCMH가 뚜렷이 뛰어나, 엔드 투 엔드 공동 학습의 이점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.