Skip to main content
QUICK REVIEW

[논문 리뷰] Coupled CycleGAN: Unsupervised Hashing Network for Cross-Modal Retrieval

Chao Li, Cheng Deng|arXiv (Cornell University)|2019. 03. 06.
Advanced Image and Video Retrieval Techniques인용 수 6
한 줄 요약

이 논문은 레이블이 없는 데이터를 요구하지 않고 공유 표현과 신뢰할 수 있는 해시 코드를 동시에 학습하는 비지도 병합 사이클 GAN 프레임워크인 UCH를 제안한다. 외부 사이클 GAN을 통해 표현 학습을, 내부 사이클 GAN을 통해 해시 코드 생성을 수행함으로써 엔드 투 엔드 최적화를 가능하게 하여, MIRFlickr25k, IAPR TC-12, COCO 데이터셋에서 최신 기술 수준의 성능을 달성하며, 64비트 코드 길이에서 MAP 점수까지 0.679에 이를 수 있다.

ABSTRACT

In recent years, hashing has attracted more and more attention owing to its superior capacity of low storage cost and high query efficiency in large-scale cross-modal retrieval. Benefiting from deep leaning, continuously compelling results in cross-modal retrieval community have been achieved. However, existing deep cross-modal hashing methods either rely on amounts of labeled information or have no ability to learn an accuracy correlation between different modalities. In this paper, we proposed Unsupervised coupled Cycle generative adversarial Hashing networks (UCH), for cross-modal retrieval, where outer-cycle network is used to learn powerful common representation, and inner-cycle network is explained to generate reliable hash codes. Specifically, our proposed UCH seamlessly couples these two networks with generative adversarial mechanism, which can be optimized simultaneously to learn representation and hash codes. Extensive experiments on three popular benchmark datasets show that the proposed UCH outperforms the state-of-the-art unsupervised cross-modal hashing methods.

연구 동기 및 목표

  • 기존의 비지도 교차 모달 해싱 방법이 표현과 해시 코드를 별도로 학습함으로써 상관관계 학습이 최적화되지 않는 한계를 해결하기 위해.
  • 교차 모달 검색에서 비용이 많이 드는 레이블 데이터에 의존하지 않고, 공유 표현과 압축된 이진 코드를 엔드 투 엔드로 학습할 수 있도록 하기 위해.
  • 이중 사이클 GAN 아키텍처를 통해 표현 학습과 해시 코드 생성을 결합함으로써 검색 정확도를 향상시키기 위해.
  • 통합 프레임워크 내에서 상호 최적화를 통해 표현 학습과 해싱 학습 모두에서 최적의 성능을 달성하기 위해.
  • 비지도 설정 하에서 표준 벤치마크 데이터셋에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 프레임워크는 이미지 및 텍스트 인코더(E^I, E^T), 생성기(G^{I→T}_f, G^{T→I}_f), 판별기(D^I_f, D^T_f)로 구성된 외부 사이클 GAN을 활용하여 공유된 모odal 무관 표현을 학습한다.
  • 공유 표현에서 신뢰할 수 있는 이진 해시 코드를 생성하기 위해, 생성기(G^{I→T}_z, G^{T→I}_z)와 판별기(D^T_z, D^I_z)로 구성된 내부 사이클 GAN을 사용한다.
  • 두 개의 사이클 네트워크는 생성적 적대적 메커니즘을 통해 공동 최적화되어 표현 학습과 해시 코드 생성을 동기화하는 엔드 투 엔드 학습을 가능하게 한다.
  • 모델은 명시적 레이블 없이도 이미지-텍스트 쌍 간의 의미적 유사성을 유지하기 위해 트리플릿 유사도 손실을 사용한다.
  • 특징 추출 및 해시 코드 생성을 위해 두 개의 완전 연결 층(예: 256→128→32)을 활용하며, 이미지에 대한 학습률은 10⁻⁴, 텍스트에 대한 학습률은 10⁻²로 설정한다.
  • 프레임워크는 배치 크기 128과 가중치 감쇠 10⁻¹로 학습되며, 성능 평가에는 평균 평균 정확도(MAP)와 Precision@1000을 사용한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 조건에서 표현 학습과 해시 코드 생성을 동시에 최적화할 수 있는 통합 딥 러닝 프레임워크는 존재하는가?
  • RQ2외부 표현 학습과 내부 해시 생성을 위한 두 개의 사이클 GAN을 결합함으로써, 분리된 접근 방식에 비해 검색 정확도가 어떻게 향상되는가?
  • RQ3제안된 방법은 표준 벤치마크에서 기존의 비지도 교차 모달 해싱 방법보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4이중 방향 생성을 통한 상호 모달 상관관계의 반복적이고 적대적인 학습이 더 정확하고 강건한 해시 코드를 생성하는가?
  • RQ5모델은 다양한 코드 길이와 검색 작업(이미지-텍스트 및 텍스트-이미지)에서 어떻게 성능을 발휘하는가?

주요 결과

  • UCH는 MIRFlickr25k, IAPR TC-12, Microsoft COCO 데이터셋에서 모든 코드 길이(16, 32, 64비트)에서 가장 높은 평균 평균 정확도(MAP)를 달성한다.
  • MIRFlickr25k에서 UCH는 64비트 코드 길이에서 MAP 0.679를 기록하며, UGACH(0.616) 및 기타 최신 비지도 방법들을 크게 앞서나간다.
  • IAPR TC-12에서 UCH는 64비트 코드 길이에서 MAP 0.488을 기록하며, UGACH(0.480) 및 기타 경쟁 방법들을 초월한다.
  • Precision@1000 곡선은 모든 데이터셋과 코드 길이에서 UCH가 모든 베이스라인보다 일관되게 높은 정밀도를 유지함을 보여준다.
  • PR 곡선은 UCH가 0에서 64까지의 모든 해밍 반경 값에서 더 우수한 검색 성능을 달성함을 입증한다.
  • 절단 실험 결과, 병합 사이클 설계가 상호 최적화를 가능하게 하여 표현 품질 향상과 해시 코드 신뢰성 향상을 높임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.