Skip to main content
QUICK REVIEW

[논문 리뷰] Category-Based Deep CCA for Fine-Grained Venue Discovery from Multimodal Data

Yi Yu, Suhua Tang|arXiv (Cornell University)|2018. 05. 08.
Advanced Image and Video Retrieval Techniques참고 문헌 23인용 수 5
한 줄 요약

이 논문은 이미지-텍스트 쌍 간의 쌍별 상관관계와 동일 유형의 다양한 범위 간의 범주 기반 상관관계를 동시에 최적화하는 새로운 딥러닝 모델인 범주 기반 딥 CCA(C-DCCA)를 제안한다. 이는 다중모odal 데이터로부터 동시에 정확한 범위 검색과 그룹 범위 검색을 가능하게 한다. C-DCCA는 UCSD 데이터셋에서 VGG16+Doc2Vec 특징을 사용할 때 MAP 0.496을 기록하며 최신 기술(SOTA)을 능가한다.

ABSTRACT

In this work, travel destination and business location are taken as venues. Discovering a venue by a photo is very important for context-aware applications. Unfortunately, few efforts paid attention to complicated real images such as venue photos generated by users. Our goal is fine-grained venue discovery from heterogeneous social multimodal data. To this end, we propose a novel deep learning model, Category-based Deep Canonical Correlation Analysis (C-DCCA). Given a photo as input, this model performs (i) exact venue search (find the venue where the photo was taken), and (ii) group venue search (find relevant venues with the same category as that of the photo), by the cross-modal correlation between the input photo and textual description of venues. In this model, data in different modalities are projected to a same space via deep networks. Pairwise correlation (between different modal data from the same venue) for exact venue search and category-based correlation (between different modal data from different venues with the same category) for group venue search are jointly optimized. Because a photo cannot fully reflect rich text description of a venue, the number of photos per venue in the training phase is increased to capture more aspects of a venue. We build a new venue-aware multimodal dataset by integrating Wikipedia featured articles and Foursquare venue photos. Experimental results on this dataset confirm the feasibility of the proposed method. Moreover, the evaluation over another publicly available dataset confirms that the proposed method outperforms state-of-the-arts for cross-modal retrieval between image and text.

연구 동기 및 목표

  • 실세계의 사용자 생성 사진과 풍부한 텍스트 기술을 기반으로 한 세밀한 범위 탐색 과제를 해결하기 위해.
  • 정확한 범위 검색(특정 범위를 찾기)과 그룹 범위 검색(동일 범주에 속하는 유사한 범위 찾기)을 동시에 최적화하기 위해.
  • 위키피디아와 퍼스콰이어에서 유래한 이질적인 다중모달 데이터를 활용하여 이미지와 텍스트 간의 교차모달 상관관계 학습을 향상시키기 위해.
  • 훈련 시 각 범위당 사진 수를 늘려 다양한 시각적 측면을 포착함으로써 표현 학습을 향상시키기 위해.
  • 교차모달 검색을 위한 새로 구축한 다중모달 범위 데이터셋과 공개된 UCSD 데이터셋에서 방법을 검증하기 위해.

제안 방법

  • C-DCCA는 딥 CCA를 확장하여 두 가지 유형의 상관관계를 도입한다: 동일 범위에서의 이미지와 텍스트 간의 쌍별 상관관계, 동일 범주에 속한 다른 범위의 이미지와 텍스트 간의 범주 기반 상관관계.
  • 딥 신경망이 이미지 및 텍스트 특징을 공유 잠재 공간으로 매핑하여 교차모달 상관관계를 최대화한다.
  • 정확한 범위 검색 성능와 그룹 범위 검색 성능를 균형 잡는 공동 손실 함수를 사용하여 두 상관관계 목표를 동시에 최적화한다.
  • 시각적 특징 추출에 VGG16을, 텍스트 특징 학습에 Doc2Vec를 사용하며, 도메인 특화 표현 향상을 위해 미세조정을 적용한다.
  • 위키피디아의 주요 기사(텍스트)와 퍼스콰이어 범위 사진(이미지)를 통합하여 새로운 다중모달 데이터셋을 구축하였으며, 각 범위의 시각적 다양성을 증가시켰다.
  • 검색 공간을 줄이고 정확한 범위 검색 성능를 향상시키기 위해 굵은 지리적 위치 정보를 사용한다.

실험 결과

연구 질문

  • RQ1쌍별 상관관계와 범주 기반 상관관계를 동시에 최적화하면 정확한 범위 검색과 그룹 범위 검색 성능가 모두 향상되는가?
  • RQ2위키피디아 텍스트와 한 범위당 한 장의 이미지만을 사용하는 것에 비해, 퍼스콰이어에서 추가적인 범위 사진을 통합하면 표현 학습에 어떤 영향을 미치는가?
  • RQ3수동으로 설계된 특징(예: SIFThist, LDA)에 비해 딥 특징(예: VGG16)과 문맥 기반 텍스트 임베딩(예: Doc2Vec)을 사용할 경우 교차모달 검색 성능는 어느 정도 향상되는가?
  • RQ4사전 훈련된 모델을 범위 특화 데이터셋에서 미세조정하면 교차모달 검색 성능가 향상되는가?
  • RQ5粗근지리적 위치 정보는 C-DCCA와 표준 DCCA 간의 정확한 범위 검색 성능 격차에 어떤 영향을 미치는가?

주요 결과

  • C-DCCA는 VGG16+Doc2Vec 특징을 사용하여 UCSD 데이터셋에서 MAP 0.496을 달성하였으며, 최신 기술(SOTA)인 SCM(0.277 MAP)을 크게 능가한다.
  • 딥 특징을 사용할 경우 DCCA 및 기타 최신 기술 대비 그룹 범위 검색 성능가 15~20% 향상되었으며, 특히 딥 특징 사용 시 두드러진 성능 향상이 관찰되었다.
  • SIFThist 대비 VGG16를 사용할 경우 MAP가 15% 이상 향상되어 딥 특징이 복잡한 시각적 의미를 더 잘 포착함을 입증한다.
  • VGG16의 미세조정과 Doc2Vec 모델 재학습으로 인해 MAP가 4.1%p 절대적 향상(0.455 → 0.496)을 기록하였으며, 이는 도메인 특화 적응이 성능 향상에 기여함을 보여준다.
  • 粗근지리적 위치 정보를 사용할 경우 라스베가스에서 MRR1이 0.8, 런던에서 0.7에 도달하여, 위치 사전 지식이 DCCA와의 성능 격차를 줄이는 데 기여함을 확인하였다.
  • 정확한 범위 검색 성능가 略로 감소하더라도 그룹 범위 검색 성능가 유지되는 것으로 나타나, 범주 기반 상관관계 학습의 효과성을 확인할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.