[论文解读] T-VSE: Transformer-Based Visual Semantic Embedding
该论文提出 T-VSE,一种基于 Transformer 的视觉语义嵌入模型,在大规模电商图像-文本检索任务中显著优于传统的 RNN 和词平均方法。该模型在包含 1210 万个商品图像-标题对的大规模电商数据集上进行训练,实现了最先进性能,文本到图像检索的 R@1 达 38.1%,R@100 达 96.3%,表明当在足够大规模的数据集上并采用合适策略进行训练时,Transformer 模型在视觉-语言任务中同样可以表现出色。
Transformer models have recently achieved impressive performance on NLP tasks, owing to new algorithms for self-supervised pre-training on very large text corpora. In contrast, recent literature suggests that simple average word models outperform more complicated language models, e.g., RNNs and Transformers, on cross-modal image/text search tasks on standard benchmarks, like MS COCO. In this paper, we show that dataset scale and training strategy are critical and demonstrate that transformer-based cross-modal embeddings outperform word average and RNN-based embeddings by a large margin, when trained on a large dataset of e-commerce product image-title pairs.
研究动机与目标
- 探究在大规模数据集上训练时,基于 Transformer 的模型是否能在视觉语义嵌入任务中超越 RNN 和词平均方法。
- 评估数据集规模和训练策略对 Transformer 模型在视觉-语言任务中性能的影响。
- 证明大规模预训练可使 Transformer 模型在跨模态检索中实现卓越性能,反驳了以往关于其性能不佳的论断。
- 基于电商数据建立视觉-语言表征学习的强基准模型。
提出的方法
- 模型采用双流神经网络结构:使用预训练的 DenseNet 169 进行图像编码,使用基于 Transformer 的文本编码器(如 DistilBERT)进行文本编码,两者均映射到 256 维嵌入空间。
- 采用对称三元组损失(hinge 损失的最大值形式)并结合困难负样本挖掘进行训练,损失的边界值设为 0.2,以最大化正样本对之间的相似度,同时最小化负样本对之间的相似度。
- 采用两阶段训练策略:首先冻结图像编码器的卷积层,仅训练文本编码器和嵌入层,持续 2 个周期;随后以更小的初始学习率对整个模型进行微调,最多训练 50 个周期。
- 数据增强包括将图像调整为 333×333,随机裁剪为 227×227,以及训练时的随机水平翻转,推理时采用中心裁剪。
- 文本编码器初始化自预训练的 DistilBERT 模型,但模型在大规模商品数据集上进行端到端微调,词汇表大小为 30,000。
- 模型在来自亚马逊时尚商品的 1100 万个(图像,标题)对上进行训练,使用 R@K 指标在 100 万个测试集上进行评估。
实验结果
研究问题
- RQ1当在大规模数据集上训练时,基于 Transformer 的模型是否能在视觉语义嵌入任务中显著优于 RNN 和词平均模型?
- RQ2训练数据规模是否显著影响基于 Transformer 的视觉语义嵌入模型的性能?
- RQ3在结合大规模图像-文本数据的前提下,能否有效利用大规模文本语料的自监督预训练来提升视觉-语言任务的性能?
- RQ4为何以往研究报道 BERT 类模型在视觉-语言任务中表现不佳?这一问题是否可通过适当的训练策略和数据规模得到克服?
主要发现
- 采用 12 层 DistilBERT 编码器的 T-VSE 在文本到图像检索中达到 38.1% R@1 和 96.3% R@100,显著优于 AVG-VSE(12.7% R@1,81.7% R@100)和 RNN-VSE(12.7% R@1,83.3% R@100)。
- T-VSE 中图像到文本检索性能略高于文本到图像检索(R@1 分别为 40.5% 和 38.1%),可能归因于 Transformer 在文本建模方面更强的能力。
- 将训练从 30 个周期延长至 50 个周期,并使用更大的批量大小(400),使 T-VSE 在文本到图像检索中的性能提升至 38.1% R@1 和 96.3% R@100,表明更深的模型从更长的训练中获益。
- T-VSE 与基线模型(AVG-VSE、RNN-VSE)之间的性能差距显著,T-VSE 在文本到图像检索中 R@1 超过 30%,而基线模型则低于 13%。
- 结果表明,当在大规模、高质量的图像-文本数据集上训练时,Transformer 模型可在跨模态检索中超越简单模型,这与以往认为其性能不佳的论断相悖。
- 本研究表明,数据集规模和训练策略至关重要——大规模数据与恰当的微调策略可使 Transformer 模型在视觉语义嵌入任务中实现最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。