Skip to main content
QUICK REVIEW

[论文解读] Category-Based Deep CCA for Fine-Grained Venue Discovery from Multimodal Data

Yi Yu, Suhua Tang|arXiv (Cornell University)|May 8, 2018
Advanced Image and Video Retrieval Techniques参考文献 23被引用 5
一句话总结

本文提出了一种新型深度学习模型——基于类别的深度CCA(C-DCCA),通过联合优化来自同一场所的图像-文本对之间的成对相关性,以及同类型场所之间的类别相关性,实现了从多模态数据中同时进行精确和群体场所检索。C-DCCA在跨模态检索任务中优于当前最先进方法,在UCSD数据集上使用VGG16+Doc2Vec特征时,MAP达到0.496。

ABSTRACT

In this work, travel destination and business location are taken as venues. Discovering a venue by a photo is very important for context-aware applications. Unfortunately, few efforts paid attention to complicated real images such as venue photos generated by users. Our goal is fine-grained venue discovery from heterogeneous social multimodal data. To this end, we propose a novel deep learning model, Category-based Deep Canonical Correlation Analysis (C-DCCA). Given a photo as input, this model performs (i) exact venue search (find the venue where the photo was taken), and (ii) group venue search (find relevant venues with the same category as that of the photo), by the cross-modal correlation between the input photo and textual description of venues. In this model, data in different modalities are projected to a same space via deep networks. Pairwise correlation (between different modal data from the same venue) for exact venue search and category-based correlation (between different modal data from different venues with the same category) for group venue search are jointly optimized. Because a photo cannot fully reflect rich text description of a venue, the number of photos per venue in the training phase is increased to capture more aspects of a venue. We build a new venue-aware multimodal dataset by integrating Wikipedia featured articles and Foursquare venue photos. Experimental results on this dataset confirm the feasibility of the proposed method. Moreover, the evaluation over another publicly available dataset confirms that the proposed method outperforms state-of-the-arts for cross-modal retrieval between image and text.

研究动机与目标

  • 为解决从真实世界用户生成的照片和丰富文本描述中进行细粒度场所发现的挑战。
  • 联合优化精确场所检索(查找特定场所)和群体场所检索(查找同类别相似场所)。
  • 通过利用来自Wikipedia和Foursquare的异构多模态数据,提升图像与文本之间的跨模态相关性学习。
  • 通过增加训练过程中每个场所的照片数量,提升表征学习能力,以捕捉更丰富的视觉特征。
  • 在新构建的多模态场所数据集和公开的UCSD数据集上验证该方法在跨模态检索任务中的有效性。

提出的方法

  • C-DCCA通过引入两种相关性类型扩展了Deep CCA:来自同一场所的图像与文本之间的成对相关性,以及来自同类别不同场所的图像与文本之间的类别相关性。
  • 深度神经网络将图像和文本特征映射到共享潜在空间,在该空间中最大化跨模态相关性。
  • 模型通过联合损失函数同时优化两种相关性目标,以平衡精确场所检索与群体场所检索的性能表现。
  • 方法采用VGG16进行视觉特征提取,使用Doc2Vec进行文本特征学习,并通过微调提升领域特定表征能力。
  • 通过整合Wikipedia的精选文章(文本)与Foursquare的场所照片(图像),构建了一个新的多模态数据集,提升了每个场所的视觉多样性。
  • 利用粗略地理位置信息以缩小搜索空间,提升精确场所检索性能。

实验结果

研究问题

  • RQ1联合优化成对相关性与类别相关性是否能同时提升精确场所检索与群体场所检索的性能?
  • RQ2与仅依赖Wikipedia文本和每个场所一张图片相比,从Foursquare引入更多场所照片在表征学习方面有何提升作用?
  • RQ3使用深度特征(如VGG16)和上下文文本嵌入(如Doc2Vec)相较于手工设计特征(如SIFThist、LDA)在跨模态检索中有多大提升?
  • RQ4在场所特定数据集上对预训练模型进行微调是否能提升跨模态检索性能?
  • RQ5粗略地理位置信息在精确场所检索中对C-DCCA与标准DCCA之间性能差距的影响程度如何?

主要发现

  • 在UCSD数据集上,C-DCCA使用VGG16+Doc2Vec特征时,MAP达到0.496,显著优于SOTA方法SCM(MAP为0.277)。
  • 与DCCA及其他最先进方法相比,该模型在群体场所检索任务中性能提升了15–20%,尤其在使用深度特征时更为显著。
  • 与SIFThist相比,使用VGG16使MAP提升超过15个百分点,证明深度特征在捕捉复杂视觉语义方面的优越性。
  • 对VGG16进行微调并重新训练Doc2Vec模型后,MAP绝对提升4.1%(从0.455提升至0.496),表明领域自适应能有效提升性能。
  • 在精确场所检索中,当使用粗略地理位置信息时,MRR1在洛杉矶达到0.8,在伦敦达到0.7,表明位置先验有助于缩小与DCCA的性能差距。
  • 即使在精确场所检索性能略有下降的情况下,该方法在群体场所检索中仍保持强劲性能,证实了基于类别的相关性学习的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。