Skip to main content
QUICK REVIEW

[논문 리뷰] SCH-GAN: Semi-supervised Cross-modal Hashing by Generative Adversarial Network

Jian Zhang, Yuxin Peng|arXiv (Cornell University)|2018. 02. 07.
Advanced Image and Video Retrieval Techniques참고 문헌 40인용 수 4
한 줄 요약

이 논문은 레이블이 없는 데이터로부터 하드한 마진-양성 예제를 생성하여 교차 모달 검색 성능을 향상시키기 위해 생성적 적대적 네트워크를 활용하는 반감독형 교차 모달 해싱 방법인 SCH-GAN을 제안한다. 생성 모델은 정보가 풍부한 예제를 적대적으로 선택하고, 분류 모델은 이를 구분하도록 학습하여 NUSWIDE, Wikipedia, MIRFlickr 데이터셋에서 최신 기술 수준의 성능을 달성하며, MAP 점수는 최대 0.758에 이를 수 있다.

ABSTRACT

Cross-modal hashing aims to map heterogeneous multimedia data into a common Hamming space, which can realize fast and flexible retrieval across different modalities. Supervised cross-modal hashing methods have achieved considerable progress by incorporating semantic side information. However, they mainly have two limitations: (1) Heavily rely on large-scale labeled cross-modal training data which are labor intensive and hard to obtain. (2) Ignore the rich information contained in the large amount of unlabeled data across different modalities, especially the margin examples that are easily to be incorrectly retrieved, which can help to model the correlations. To address these problems, in this paper we propose a novel Semi-supervised Cross-Modal Hashing approach by Generative Adversarial Network (SCH-GAN). We aim to take advantage of GAN's ability for modeling data distributions to promote cross-modal hashing learning in an adversarial way. The main contributions can be summarized as follows: (1) We propose a novel generative adversarial network for cross-modal hashing. In our proposed SCH-GAN, the generative model tries to select margin examples of one modality from unlabeled data when giving a query of another modality. While the discriminative model tries to distinguish the selected examples and true positive examples of the query. These two models play a minimax game so that the generative model can promote the hashing performance of discriminative model. (2) We propose a reinforcement learning based algorithm to drive the training of proposed SCH-GAN. The generative model takes the correlation score predicted by discriminative model as a reward, and tries to select the examples close to the margin to promote discriminative model by maximizing the margin between positive and negative data. Experiments on 3 widely-used datasets verify the effectiveness of our proposed approach.

연구 동기 및 목표

  • 비용이 많이 드는 레이블이 있는 데이터에 크게 의존하고 레이블이 없는 데이터를 충분히 활용하지 못하는 지도 학습 기반 교차 모달 해싱의 한계를 해결하기 위해.
  • 특히 다른 모odal에서 유래한 마진 예제를 포함한 대규모 레이블이 없는 데이터의 풍부한 구조적 정보를 활용하여 해싱 성능을 향상시키기 위해.
  • 어려운 정보성 예제를 기반으로 적대적으로 훈련하는 생성 모델을 통해 분류 모델의 학습 능력을 향상시키는 반감독 프레임워크를 개발하기 위해.
  • 강화 학습을 GAN 훈련 과정에 통합하여, 분류 모델의 상관관계 점수에 기반해 생성 모델이 보상받도록 하여 생성된 하드 예제의 품질을 향상시키기 위해.

제안 방법

  • 쿼리가 한 모달리티에서 제공될 때, 생성자가 레이블이 없는 데이터에서 마진-양성 예제를 선택하는 새로운 GAN 기반 프레임워크를 설계하였다.
  • 판별자는 쿼리와 생성된 예제 간의 상관관계를 평가하여 진정한 양성 예제와 구분한다.
  • 두 모델은 최소-최대 게임을 통해 상호 작용하며, 생성자는 판별자를 더욱 어렵게 만들기 위해 선택 능력을 향상시키고, 이로 인해 분류 모델의 강건성이 향상된다.
  • 강화 학습이 생성자의 훈련을 이끈다: 보상 신호는 판별자가 예측한 상관관계 점수이며, 이는 분류 마진 근처의 예제를 선택하도록 유도한다.
  • 삼중체 순서 손실을 사용하여 분류 모델을 최적화함으로써, 양성 예제가 음성 예제보다 해밍 공간에서 더 가까워지도록 보장한다.
  • 종합적인 적대적 및 대비 목표를 통해 종단 간 훈련이 이루어져 효과적인 교차 모달 임베딩 학습이 가능하다.

실험 결과

연구 질문

  • RQ1생성적 적대적 네트워크는 레이블이 없는 데이터를 효과적으로 활용하여 교차 모달 해싱 성능을 향상시킬 수 있는가?
  • RQ2레이블이 없는 데이터에서 유래한 마진 예제를 사용한 적대적 훈련은 분류 모델이 양성 및 음성 쌍을 더 잘 구분할 수 있도록 능력을 향상시킬 수 있는가?
  • RQ3판별자 피드백을 기반으로 한 강화 학습을 통합함으로써 생성된 하드 예제의 품질이 교차 모달 해싱에서 향상되는가?
  • RQ4제안된 SCH-GAN은 검색 정확도 측면에서 최신 기술 수준의 지도 학습 및 비지도 학습 기반 교차 모달 해싱 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • NUSWIDE 데이터셋에서 SCH-GAN은 이미지-텍스트 검색에서 최고의 비지도 학습 방법인 CCQ에 비해 평균 MAP를 0.505에서 0.730으로 향상시키고, 텍스트-이미지 검색에서는 0.490에서 0.758로 향상되었다.
  • SCH-GAN은 최고의 지도 학습 방법인 SePH를 초월하여 이미지-텍스트 검색에서 평균 MAP를 0.715에서 0.730으로 0.015 향상시키고, 텍스트-이미지 검색에서는 0.654에서 0.758로 0.104 향상되었다.
  • 딥 러닝 기반 방법인 DCMH와 비교했을 때, SCH-GAN은 이미지-텍스트 검색에서 MAP를 0.652에서 0.730으로, 텍스트-이미지 검색에서는 0.696에서 0.758로 향상시켰다.
  • 절단 분석 결과, 적대적 훈련이 성능 향상에 크게 기여하며, 모든 세 데이터셋에서 적대적 훈련 없이 수행된 기준 모델 Dis보다 SCH-GAN이 일관되게 뛰어난 성능을 보였다.
  • 정밀도-재현율 곡선과 상위-K 정밀도 결과는 SCH-GAN이 모든 세 데이터셋에서 최고의 정확도를 달성함을 확인하며, 그 강건성과 효과성을 입증한다.
  • 훈련 과정에서 생성자가 업데이트될 때마다 분류 모델의 정확도가 증가함을 관찰하여, 생성자가 정보가 풍부하고 어려운 예제를 성공적으로 선택하여 분류 모델의 일반화 능력을 향상시켰음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.