Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Triplet Neural Networks with Cluster-CCA for Audio-Visual Cross-modal Retrieval

Donghuo Zeng, Yi Yu|arXiv (Cornell University)|2019. 08. 10.
Advanced Image and Video Retrieval Techniques참고 문헌 65인용 수 4
한 줄 요약

이 논문은 삼중체 손실과 클러스터-CCA를 결합하여 음성-시각 간 다중모态 검색을 위한 딥 트리플릿 신경망(TNN-C-CCA)을 제안한다. 이는 음성과 영상 모odal 간 상관관계를 극대화하면서도 긍정 쌍과 부정 쌍을 구별함으로써 분류 가능한 공동 임bedding을 학습한다. 제안된 방법은 두 데이터셋에서 여섯 개인 CCA 기반 및 네 가지 최신 기술보다 뛰어난 성능을 보이며, 10개의 상관성 성분을 사용할 경우 음성에서 시각으로의 검색에서 MAP 74.66%를 달성하고, 시각에서 음성으로의 검색에서는 73.77%를 기록한다.

ABSTRACT

Cross-modal retrieval aims to retrieve data in one modality by a query in another modality, which has been a very interesting research issue in the field of multimedia, information retrieval, and computer vision, and database. Most existing works focus on cross-modal retrieval between text-image, text-video, and lyrics-audio.Little research addresses cross-modal retrieval between audio and video due to limited audio-video paired datasets and semantic information. The main challenge of audio-visual cross-modal retrieval task focuses on learning joint embeddings from a shared subspace for computing the similarity across different modalities, where generating new representations is to maximize the correlation between audio and visual modalities space. In this work, we propose a novel deep triplet neural network with cluster canonical correlation analysis(TNN-C-CCA), which is an end-to-end supervised learning architecture with audio branch and video branch.We not only consider the matching pairs in the common space but also compute the mismatching pairs when maximizing the correlation. In particular, two significant contributions are made: i) a better representation by constructing deep triplet neural network with triplet loss for optimal projections can be generated to maximize correlation in the shared subspace. ii) positive examples and negative examples are used in the learning stage to improve the capability of embedding learning between audio and video. Our experiment is run over 5-fold cross-validation, where average performance is applied to demonstrate the performance of audio-video cross-modal retrieval. The experimental results achieved on two different audio-visual datasets show the proposed learning architecture with two branches outperforms existing six CCA-based methods and four state-of-the-art based cross-modal retrieval methods.

연구 동기 및 목표

  • 제한된 쌍화된 데이터셋과 의미 정보로 인해 음성-시각 다중모달 검색 분야에 대한 연구가 부족한 점을 해결하기 위해.
  • 공유 부분공간 내에서 음성과 시각 모달 간 상관관계를 극대화하는 공동 임베딩을 학습하기 위해.
  • 삼중체 손실을 통해 긍정 쌍과 부정 쌍을 모두 통합하여 표현 학습을 향상시키기 위해.
  • 쌍별 매칭이 아닌, 동일 카테고리에 속한 모든 샘플 간의 의미 정보를 유지하기 위해.
  • 기존의 CCA 기반 및 다중모달 검색 방법보다 뛰어난 성능을 보이는 엔드 투 엔드 지도 학습 아키텍처를 개발하기 위해.

제안 방법

  • 긍정 쌍 간 유사도를 최적화하고 부정 쌍 간 이질성을 최대화함으로써 분류 가능한 임베딩을 학습하기 위해 삼중체 손실을 적용한 딥 트리플릿 신경망(TNN)을 제안한다.
  • 모든 다중모달 데이터 쌍 간 일대일 대응을 강제하고 공유 부분공간에서 상관관계를 극대화함으로써 공동 표현을 학습하기 위해 클러스터-CCA(C-CCA)를 통합한다.
  • 음성 및 영상 브랜치를 별도로 갖춘 이중 브랜치 아키텍처를 사용하며, 각 브랜치는 특징 추출을 위해 사전 훈련된 딥 CNN을 처리한다.
  • 거리가 최소한의 마진 이상으로 긍정 쌍 간 거리가 부정 쌍 간 거리보다 작아지도록 보장하기 위해 마진 기반 삼중체 손실 함수를 적용한다.
  • 음성 및 시각 특징가 공유 투영 공간으로 매핑되어 최대 캐논리컬 상관관계를 극대화하며, 차원은 상관성 성분의 수로 제어된다.
  • 성능 최적화를 위해 마진과 배치 크기의 초모수 조정을 수행하며, 5겹 교차검증을 실시한다.

실험 결과

연구 질문

  • RQ1삼중체 네트워크와 클러스터-CCA를 함께 사용하여 쌍별 및 비쌍별 의미 관계를 동시에 모델링함으로써 음성-시각 다중모달 검색 성능을 향상시킬 수 있는가?
  • RQ2삼중체 손실에 부정 쌍을 포함시킬 경우, 표준 CCA나 DCCA에 비해 학습된 임베딩의 분류 능력은 어떻게 향상되는가?
  • RQ3음성-시각 검색에서 클러스터-CCA에 최적의 상관성 성분 수는 얼마이며, 성능에 어떤 영향을 미치는가?
  • RQ4마진과 배치 크기와 같은 초모수는 모델의 MAP 성능에 어떻게 영향을 미치는가?
  • RQ5제안된 TNN-C-CCA 아키텍처는 실제 음성-시각 데이터셋에서 기존의 CCA 기반 및 최신 기술보다 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 제안된 TNN-C-CCA 모델은 10개의 상관성 성분을 사용할 경우 음성에서 시각으로의 검색에서 평균 평균 정확도(MAP) 74.66%를 달성하고, 시각에서 음성으로의 검색에서는 73.77%를 기록한다.
  • 이 모델은 두 개의 다른 음성-시각 데이터셋에서 여섯 개인 CCA 기반 방법과 네 가지 최신 기술보다 뛰어난 성능을 보였다.
  • 최적의 성능는 배치 크기가 400이고 마진이 0.5일 때 달성되며, 800개 이상의 배치 크기로 넘어가면 과적합 또는 불안정성으로 인해 성능이 급격히 떨어진다.
  • 상관성 성분의 수는 성능에 큰 영향을 미치며, 10개 성분에서 최고의 MAP를 기록하고, 50개 성분에서는 급격히 성능이 저하된다.
  • 배치 크기가 30일 경우(700개 배치) 훈련 시간은 3시간으로 줄어들었으며, 300개 배치일 경우 32시간이 소요되었지만 높은 성능를 유지한다.
  • 제거 실험 결과, 긍정 및 부정 쌍을 모두 포함한 삼중체 손실이 쌍별 상관관계에 의존하는 모델에 비해 임베딩 품질을 크게 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.