Skip to main content
QUICK REVIEW

[논문 리뷰] MHTN: Modal-adversarial Hybrid Transfer Network for Cross-modal Retrieval

Xin Huang, Yuxin Peng|arXiv (Cornell University)|2017. 08. 08.
Multimodal Machine Learning Applications참고 문헌 40인용 수 9
한 줄 요약

이 논문은 대규모 단모달 데이터셋(예: ImageNet)에서 비디오, 음성, 3D 데이터를 포함한 텍스트, 이미지, 비디오, 음성, 3D 데이터 간의 의미 일관성을 향상시키는 새로운 엔드 투 엔드 모달 적대적 하이브리드 전이 네트워크인 MHTN을 제안한다. 별자리 구조의 지식 전이 하위망과 모달 적대적 훈련 메커니즘을 결합함으로써 MHTN은 다중모달 환경에서의 의미 표현 학습을 향상시키고, 5모달 XMedia 데이터셋을 포함한 네 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Cross-modal retrieval has drawn wide interest for retrieval across different modalities of data. However, existing methods based on DNN face the challenge of insufficient cross-modal training data, which limits the training effectiveness and easily leads to overfitting. Transfer learning is for relieving the problem of insufficient training data, but it mainly focuses on knowledge transfer only from large-scale datasets as single-modal source domain to single-modal target domain. Such large-scale single-modal datasets also contain rich modal-independent semantic knowledge that can be shared across different modalities. Besides, large-scale cross-modal datasets are very labor-consuming to collect and label, so it is significant to fully exploit the knowledge in single-modal datasets for boosting cross-modal retrieval. This paper proposes modal-adversarial hybrid transfer network (MHTN), which to the best of our knowledge is the first work to realize knowledge transfer from single-modal source domain to cross-modal target domain, and learn cross-modal common representation. It is an end-to-end architecture with two subnetworks: (1) Modal-sharing knowledge transfer subnetwork is proposed to jointly transfer knowledge from a large-scale single-modal dataset in source domain to all modalities in target domain with a star network structure, which distills modal-independent supplementary knowledge for promoting cross-modal common representation learning. (2) Modal-adversarial semantic learning subnetwork is proposed to construct an adversarial training mechanism between common representation generator and modality discriminator, making the common representation discriminative for semantics but indiscriminative for modalities to enhance cross-modal semantic consistency during transfer process. Comprehensive experiments on 4 widely-used datasets show its effectiveness and generality.

연구 동기 및 목표

  • 딥 다모달 검색에서 부족한 레이블이 부여된 다모달 훈련 데이터의 문제를 해결하기 위해.
  • 대규모 단모달 데이터셋(예: ImageNet)에서 풍부한 모달 독립적 의미 지식을 활용하여 다모달 학습에 기여하기 위해.
  • 단모달 소스에서 다모달 타겟 도메인으로 지식 전이 시 다모달 의미 일관성을 유지하기 위해.
  • 지식 전이와 모달 간 의미 정렬을 동시에 최적화하는 엔드 투 엔드 프레임워크를 개발하기 위해.
  • 텍스트, 이미지, 비디오, 음성, 3D 데이터를 포함한 다양한 다모달 검색 작업에 대한 일반화 능력과 효과성을 입증하기 위해.

제안 방법

  • 별자리 구조의 모달 공유 지식 전이 하위망은 단모달 소스 도메인(예: ImageNet)에서 타겟 도메인의 모든 모달로 지식을 공동으로 전이하여 모달 독립적 의미 지식을 정제한다.
  • 모달 적대적 의미 학습 하위망은 공통 표현 생성기와 모달 구분기 사이에 적대적 훈련을 도입하여 공통 표현이 의미적으로 구분 가능하면서도 모달에 대해 불변이 되도록 한다.
  • 적대적 훈련은 공통 표현이 모달 간에 구별되지 않도록 유도함으로써 이질성 갭을 명시적으로 줄이며, 의미 구분 가능성을 유지한다.
  • 프레임워크는 소스 도메인 감독 손실을 통합하여 소스 도메인의 일반 지식을 활용한다. 이는 소스와 타겟 도메인 간 클래스 레이블이 다를 경우에도 유의미하다.
  • 다중모달 대비 손실, 적대적 손실, 소스 도메인 감독 손실을 조합한 하이브리드 손실을 사용하여 엔드 투 엔드로 모델을 훈련한다.
  • 특징 추출기로 AlexNet과 VGG19를 모두 사용하여 아키텍처를 평가하였으며, 백본 선택에 대해 뛰어난 내구성을 입증하였다.

실험 결과

연구 질문

  • RQ1대규모 단모달 데이터셋에서의 지식은 다모달 검색 성능 향상에 효과적으로 전이될 수 있는가?
  • RQ2어떻게 단모달 소스에서 모달 독립적 의미 지식을 정제하여 다모달 표현 학습을 향상시킬 수 있는가?
  • RQ3공통 표현 생성기와 모달 구분기 사이의 적대적 훈련이 다모달 의미 일관성에 얼마나 기여하는가?
  • RQ4클래스가 불일치하는 소스 도메인 감독은 다모달 검색에서 여전히 유의미한 이점을 제공하는가?
  • RQ5제안된 MHTN 프레임워크는 다섯 모달리티를 포함한 다양한 다모달 검색 작업에 일반화될 수 있는가?

주요 결과

  • MHTN은 5모달 XMedia 데이터셋을 포함한 네 가지 널리 사용되는 다모달 검색 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 소스 이미지 경로를 제거한 경우(MHTN (NoSource)) 성능 저하가 지속적으로 발생함으로써 단모달 소스 지식이 다모달 학습에 기여한다는 점을 확인한다.
  • 모달 적대적 의미 학습 하위망을 제거한 경우(MHTN (NoSLnet)) 검색 정확도가 낮아지며, 이는 이 하위망이 다모달 의미 일관성을 유지하는 데 기여한다는 점을 입증한다.
  • 적대적 훈련 전략을 제거한 경우(MHTN (NoAdver)) 성능 저하가 발생함으로써 모달 불변 표현 학습이 다모달 정렬을 향상시킨다는 점을 보여준다.
  • 소스 및 타겟 경로에서 AlexNet을 VGG19로 교체하면 모든 데이터셋에서 검색 정확도가 향상되며, 특히 Pascal Sentences에서 두드러진 성능 향상이 나타나, 이 방법이 백본 선택에 대해 뛰어난 내구성을 지닌다는 것을 입증한다.
  • 이미지가 없는 다모달 작업(예: 텍스트 → 비디오, 3D → 텍스트)에서도 MHTN은 소스 이미지 경로에서 상당한 이점을 얻으며, 이는 다양한 모달 간의 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.