Skip to main content
QUICK REVIEW

[논문 리뷰] AMC: Attention guided Multi-modal Correlation Learning for Image Search

Kan Chen, Trung Bui|arXiv (Cornell University)|2017. 04. 03.
Multimodal Machine Learning Applications참고 문헌 34인용 수 15
한 줄 요약

이 논문은 시각적 및 텍스처적 모odal을 동시에 고려하여 이미지 검색을 위한 주의 기반 다중모달 상관관계 학습 프레임워크인 AMC을 제안한다. 이는 내부 및 상호 주의 네트워크를 통해 관련 특징을 적응적으로 가중하여 구체적인 쿼리에 맞게 조정한다. 이 방법은 실제 이미지 검색 데이터셋에서 뚜렷한 성능 향상을 보이며, 이미지 캡션 랭킹 작업에서도 최신 기술을 능가하는 결과를 내보내며, 복잡한 언어 모델 없이도 Recall@10에서 승리한다.

ABSTRACT

Given a user's query, traditional image search systems rank images according to its relevance to a single modality (e.g., image content or surrounding text). Nowadays, an increasing number of images on the Internet are available with associated meta data in rich modalities (e.g., titles, keywords, tags, etc.), which can be exploited for better similarity measure with queries. In this paper, we leverage visual and textual modalities for image search by learning their correlation with input query. According to the intent of query, attention mechanism can be introduced to adaptively balance the importance of different modalities. We propose a novel Attention guided Multi-modal Correlation (AMC) learning method which consists of a jointly learned hierarchy of intra and inter-attention networks. Conditioned on query's intent, intra-attention networks (i.e., visual intra-attention network and language intra-attention network) attend on informative parts within each modality; a multi-modal inter-attention network promotes the importance of the most query-relevant modalities. In experiments, we evaluate AMC models on the search logs from two real world image search engines and show a significant boost on the ranking of user-clicked images in search results. Additionally, we extend AMC models to caption ranking task on COCO dataset and achieve competitive results compared with recent state-of-the-arts.

연구 동기 및 목표

  • 단일 모달 매칭을 넘어서 시각적 콘텐츠, 키워드, 태그 등 다양한 이미지 연관 모달을 활용해 이미지 검색의 관련성 향상.
  • 쿼리 의도의 다양성을 고려해 각 모달 내에서 정보성 있는 부분을 동적으로 선택하고 모달 간 균형을 맞추는 도전 과제 해결.
  • 인간이 수작업한 데이터와 기계가 생성한(잠재적으로 노이즈가 포함된) 다중모달 데이터를 통합할 수 있는 확장 가능한 프레임워크 개발을 통한 강건한 유사도 학습.
  • 실제 검색 로그에서의 효과성 입증 및 이미지 캡션 랭킹과 같은 관련 작업으로의 일반화 능력 입증.

제안 방법

  • AMC 프레임워크는 쿼리에 따라 유도되는 주의 맵을 생성해 관련 이미지 영역에 집중하는 시각적 내부 주의 네트워크(VAN)를 활용한다.
  • 언어 내부 주의 네트워크(LAN)는 텍스처 모달 내에서 쿼리와 개별 단어 간의 이항 유사도를 학습하여 관련 키워드를 강조한다.
  • 다중모달 상호 주의 네트워크(MTN)는 쿼리 의도에 따라 다양한 모달의 기여도를 적응적으로 조정하여 가장 관련성이 높은 모달을 강조한다.
  • 최종 상관관계 점수는 공유된 AMC 공간 내에서 쿼리 임bedding과 다중모달 임베딩 간의 코사인 거리로 계산된다.
  • 랭킹 성능 향상을 위해 하드 네거티브 마이닝을 활용한 마진 기반 대비 손실 함수를 사용해 모델을 훈련한다.
  • 프레임워크는 후기 융합과 주의 기반 융합을 모두 지원하여, 이미지 연관 모달의 수를 제한 없이 통합할 수 있다.

실험 결과

연구 질문

  • RQ1쿼리에 특화된 의도에 맞게 적응하는 주의 메커니즘이 이미지 검색에서 다중모달 상관관계 학습을 향상시키는가?
  • RQ2내부 주의 네트워크가 시각적 및 텍스처 모달 내에서 관련 없는 정보를 얼마나 효과적으로 걸러내는가?
  • RQ3고정된 융합 전략에 비해 모달 간 상호 주의가 랭킹 성능 향상에 얼마나 기여하는가?
  • RQ4자동 태깅된 키워드와 같은 노이즈가 포함된 기계 생성 메타데이터를 포함한 실제 검색 로그에 AMC가 일반화 가능한가?
  • RQ5최신 기술 모델에 비해 AMC는 이미지 캡션 랭킹과 같은 후행 작업에서 어떻게 성능을 내는가?

주요 결과

  • AMC는 CIC 벤치마크에서 41.4% Recall@1, 75.1% Recall@5, 87.8% Recall@10를 기록하여 Recall@10에서 최신 기술을 초월했으며, 이미지 캡션 랭킹 작업에서 기준 후기 융합 모델 대비 Recall@1에서 3.5%p의 절대적 향상을 이뤘다.
  • AMC-Res 모델은 COCO 데이터셋에서 이미지 캡션 랭킹 작업에서 3.5%의 절대적 Recall@1 향상을 기록했다.
  • AMC 모델은 Clickture와 Adobe Stock이라는 두 개의 실제 이미지 검색 데이터셋에서 뚜렷한 성능 향상을 보이며, 수작업 태깅 데이터와 자동 태깅 데이터 모두에서 효과성을 입증했다.
  • VGG와 ResNet 등의 다양한 이미지 특징 추출기에서 일관된 성능 향상이 관찰되어 강건성과 확장성의 잠재력을 보였다.
  • 간단한 스킵그램 기반 캡션 표현(Skip-thought vectors)을 사용하더라도 AMC는 경쟁 가능한 성능를 기록했으며, 더 고급 언어 모델과 조합했을 때의 잠재력이 높다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.