Skip to main content
QUICK REVIEW

[论文解读] HiVLP: Hierarchical Vision-Language Pre-Training for Fast Image-Text Retrieval

Feilong Chen, Xiuyi Chen|arXiv (Cornell University)|May 24, 2022
Multimodal Machine Learning Applications被引用 6
一句话总结

HiVLP 提出了一种分层视觉-语言预训练框架,通过利用低维特征进行粗粒度检索、高维特征进行细粒度检索,实现了比基于融合的模型(如 UNITER)快达 120,649 倍的推理速度,同时保持了具有竞争力的准确率,在检索性能上甚至超越了当前最先进模型。

ABSTRACT

In the past few years, the emergence of vision-language pre-training (VLP) has brought cross-modal retrieval to a new era. However, due to the latency and computation demand, it is commonly challenging to apply VLP in a real-time online retrieval system. To alleviate the defect, this paper proposes a extbf{Hi}erarchical extbf{V}ision- extbf{}Language extbf{P}re-Training ( extbf{HiVLP}) for fast Image-Text Retrieval (ITR). Specifically, we design a novel hierarchical retrieval objective, which uses the representation of different dimensions for coarse-to-fine ITR, i.e., using low-dimensional representation for large-scale coarse retrieval and high-dimensional representation for small-scale fine retrieval. We evaluate our proposed HiVLP on two popular image-text retrieval benchmarks, i.e., Flickr30k and COCO. Extensive experiments demonstrate that our HiVLP not only has fast inference speed but also can be easily scaled to large-scale ITR scenarios. The detailed results show that HiVLP is $1,427$$\sim$$120,649 imes$ faster than the fusion-based model UNITER and 2$\sim$5 faster than the fastest embedding-based model LightingDot in different candidate scenarios. It also achieves about +4.9 AR on COCO and +3.8 AR on Flickr30K than LightingDot and achieves comparable performance with the state-of-the-art (SOTA) fusion-based model METER.

研究动机与目标

  • 解决基于融合的视觉-语言模型在实时图文检索系统中高延迟的问题。
  • 克服基于嵌入的模型在大规模候选集上进行点积匹配时的计算瓶颈。
  • 通过引入基于粗粒度到细粒度的检索流水线和分层特征表征,实现实用且可扩展的高效检索。
  • 通过多粒度特征提取,在大幅降低推理时间的同时保持高检索准确率。
  • 设计一种联合优化语言表征、视觉-语言匹配以及分层检索对齐的训练框架。

提出的方法

  • 在中间的 Transformer 层中引入早期输出层(EOL),从相同的视觉和文本编码器中提取维度递增的分层特征。
  • 使用低维 EOL 输出对大规模候选集进行快速粗粒度检索,随后利用高维输出在缩小的集合上进行精确的细粒度检索。
  • 通过三种目标联合训练模型:语言表征建模(LRM)、视觉-语言匹配(VLM)和分层检索学习(HRL),以对齐不同粒度的特征。
  • 将候选集的离线编码与在线查询处理解耦,支持并行化处理,从而降低端到端延迟。
  • 利用具有共享架构的预训练视觉和语言 Transformer,以在所有层级上保持表征质量。
  • 应用 Grad-CAM 可视化验证文本标记与相关视觉区域之间的注意力对齐情况,确认跨模态对齐的有效性。

实验结果

研究问题

  • RQ1分层表征策略是否能显著加速图文检索,同时不损失准确率?
  • RQ2与单层次嵌入相比,多粒度特征提取在速度和检索性能方面表现如何?
  • RQ3所提出的 HiVLP 框架在大规模候选集(如 100K+ 张图像)上能实现多大程度的可扩展性,同时保持低延迟?
  • RQ4在 Transformer 编码器中集成早期输出层是否能实现有效且性能损失最小的粗粒度到细粒度检索?
  • RQ5在标准基准测试中,HiVLP 与当前最先进基于融合和基于嵌入的模型相比,在速度和准确率方面表现如何?

主要发现

  • 在包含 123,287 张图像的 COCO-full 基准测试中,HiVLP 的推理速度比基于融合的模型 UNITER 快达 120,649 倍。
  • 在 Flickr30k-full 基准测试中,HiVLP 比 UNITER 快 36,051 倍,证明了其在大规模检索场景下的可扩展性。
  • 在 Flickr30k 上,HiVLP 比最快的基于嵌入的模型 LightingDot 快 2.23 倍;在 COCO 上,候选集数量为五倍时,速度仍快 3.33 倍。
  • 在 COCO 上,HiVLP 比 LightingDot 的平均召回率(AR)高出 +4.9%;在 Flickr30k 上高出 +3.8%,表明其在更高效率下仍具备更优的准确率。
  • 消融实验证实,采用多层级 EOL 输出的分层检索显著提升了图像到文本和文本到图像任务的检索性能。
  • 定性结果表明,Grad-CAM 注意力图与相关视觉区域高度对齐,证实了分层框架中有效跨模态注意力学习的存在。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。