Skip to main content
QUICK REVIEW

[论文解读] T-VSE: Transformer-Based Visual Semantic Embedding

Muhammet Baştan, Arnau Ramisa|arXiv (Cornell University)|May 17, 2020
Topic Modeling参考文献 13被引用 4
一句话总结

该论文提出 T-VSE,一种基于 Transformer 的视觉语义嵌入模型,在大规模电商图像-文本检索任务中显著优于传统的 RNN 和词平均方法。该模型在包含 1210 万个商品图像-标题对的大规模电商数据集上进行训练,实现了最先进性能,文本到图像检索的 R@1 达 38.1%,R@100 达 96.3%,表明当在足够大规模的数据集上并采用合适策略进行训练时,Transformer 模型在视觉-语言任务中同样可以表现出色。

ABSTRACT

Transformer models have recently achieved impressive performance on NLP tasks, owing to new algorithms for self-supervised pre-training on very large text corpora. In contrast, recent literature suggests that simple average word models outperform more complicated language models, e.g., RNNs and Transformers, on cross-modal image/text search tasks on standard benchmarks, like MS COCO. In this paper, we show that dataset scale and training strategy are critical and demonstrate that transformer-based cross-modal embeddings outperform word average and RNN-based embeddings by a large margin, when trained on a large dataset of e-commerce product image-title pairs.

研究动机与目标

  • 探究在大规模数据集上训练时,基于 Transformer 的模型是否能在视觉语义嵌入任务中超越 RNN 和词平均方法。
  • 评估数据集规模和训练策略对 Transformer 模型在视觉-语言任务中性能的影响。
  • 证明大规模预训练可使 Transformer 模型在跨模态检索中实现卓越性能,反驳了以往关于其性能不佳的论断。
  • 基于电商数据建立视觉-语言表征学习的强基准模型。

提出的方法

  • 模型采用双流神经网络结构:使用预训练的 DenseNet 169 进行图像编码,使用基于 Transformer 的文本编码器(如 DistilBERT)进行文本编码,两者均映射到 256 维嵌入空间。
  • 采用对称三元组损失(hinge 损失的最大值形式)并结合困难负样本挖掘进行训练,损失的边界值设为 0.2,以最大化正样本对之间的相似度,同时最小化负样本对之间的相似度。
  • 采用两阶段训练策略:首先冻结图像编码器的卷积层,仅训练文本编码器和嵌入层,持续 2 个周期;随后以更小的初始学习率对整个模型进行微调,最多训练 50 个周期。
  • 数据增强包括将图像调整为 333×333,随机裁剪为 227×227,以及训练时的随机水平翻转,推理时采用中心裁剪。
  • 文本编码器初始化自预训练的 DistilBERT 模型,但模型在大规模商品数据集上进行端到端微调,词汇表大小为 30,000。
  • 模型在来自亚马逊时尚商品的 1100 万个(图像,标题)对上进行训练,使用 R@K 指标在 100 万个测试集上进行评估。

实验结果

研究问题

  • RQ1当在大规模数据集上训练时,基于 Transformer 的模型是否能在视觉语义嵌入任务中显著优于 RNN 和词平均模型?
  • RQ2训练数据规模是否显著影响基于 Transformer 的视觉语义嵌入模型的性能?
  • RQ3在结合大规模图像-文本数据的前提下,能否有效利用大规模文本语料的自监督预训练来提升视觉-语言任务的性能?
  • RQ4为何以往研究报道 BERT 类模型在视觉-语言任务中表现不佳?这一问题是否可通过适当的训练策略和数据规模得到克服?

主要发现

  • 采用 12 层 DistilBERT 编码器的 T-VSE 在文本到图像检索中达到 38.1% R@1 和 96.3% R@100,显著优于 AVG-VSE(12.7% R@1,81.7% R@100)和 RNN-VSE(12.7% R@1,83.3% R@100)。
  • T-VSE 中图像到文本检索性能略高于文本到图像检索(R@1 分别为 40.5% 和 38.1%),可能归因于 Transformer 在文本建模方面更强的能力。
  • 将训练从 30 个周期延长至 50 个周期,并使用更大的批量大小(400),使 T-VSE 在文本到图像检索中的性能提升至 38.1% R@1 和 96.3% R@100,表明更深的模型从更长的训练中获益。
  • T-VSE 与基线模型(AVG-VSE、RNN-VSE)之间的性能差距显著,T-VSE 在文本到图像检索中 R@1 超过 30%,而基线模型则低于 13%。
  • 结果表明,当在大规模、高质量的图像-文本数据集上训练时,Transformer 模型可在跨模态检索中超越简单模型,这与以往认为其性能不佳的论断相悖。
  • 本研究表明,数据集规模和训练策略至关重要——大规模数据与恰当的微调策略可使 Transformer 模型在视觉语义嵌入任务中实现最先进性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。