[论文解读] MultiSubs: A Large-scale Multimodal and Multilingual Dataset
本文提出了 MultiSubs,一个大规模多模态、多语言数据集,通过跨语言消歧和 BabelNet 将词语或文本片段在上下文句子中的使用与图像进行对齐。该数据集实现了比以往工作更紧密、更局部的图像-文本对齐。评估结果表明,图像在填空任务中提升了性能,但在词汇翻译任务中增益有限,凸显了在机器翻译中实现有效多模态融合的挑战。
This paper introduces a large-scale multimodal and multilingual dataset that aims to facilitate research on grounding words to images in their contextual usage in language. The dataset consists of images selected to unambiguously illustrate concepts expressed in sentences from movie subtitles. The dataset is a valuable resource as (i) the images are aligned to text fragments rather than whole sentences; (ii) multiple images are possible for a text fragment and a sentence; (iii) the sentences are free-form and real-world like; (iv) the parallel texts are multilingual. We set up a fill-in-the-blank game for humans to evaluate the quality of the automatic image selection process of our dataset. We show the utility of the dataset on two automatic tasks: (i) fill-in-the-blank; (ii) lexical translation. Results of the human evaluation and automatic models demonstrate that images can be a useful complement to the textual context. The dataset will benefit research on visual grounding of words especially in the context of free-form sentences, and can be obtained from https://doi.org/10.5281/zenodo.5034604 under a Creative Commons licence.
研究动机与目标
- 为解决缺乏大规模、自由形式、多语言数据集的问题,这些数据集能够将特定文本片段与图像进行局部、上下文敏感的对齐。
- 通过使模型学习完整句子上下文中词语与图像的对应关系,而非仅基于整幅图像的描述,从而提升视觉定位性能。
- 构建一个包含多样化、非特定领域图像以及多语言平行文本片段的数据集,以支持在真实语言使用中的泛化能力。
- 通过人工标注的填空游戏评估数据集质量,检验图像在上下文理解中的实用性。
- 在两个任务中展示数据集的实用性:填空任务和词汇翻译任务,比较使用和不使用视觉信号的模型表现。
提出的方法
- 从英语及其他四种语言的电影字幕平行语料库中构建 MultiSubs,选取视觉显著的词语进行图像说明。
- 应用跨语言多模态消歧:利用平行文本在不同语言间解决词语义歧义,借助 BabelNet 找到交集的同义词集(synsets)。
- 从 BabelNet 中检索并匹配与消歧后的同义词集对应的图像,确保图像与上下文中目标词语的语义相关性。
- 允许每个文本片段对应多个图像,以反映语义和视觉上的多样性,增强对歧义的鲁棒性。
- 设计一个人工评估游戏,参与者在有或无图像提示的情况下猜测句子中缺失的词语,以评估数据集质量。
- 在两个任务上训练并评估模型:填空任务(有图与无图)以及跨多种语言的词汇翻译任务(使用源句和图像线索)
实验结果
研究问题
- RQ1一个大规模、多语言、多模态数据集,具备局部图像-文本对齐,是否能提升自由形式、上下文语言中的视觉定位性能?
- RQ2与仅使用文本的模型相比,图像作为上下文线索在填空任务中对词语预测的有效性如何?
- RQ3当与文本上下文结合时,视觉信号在多大程度上提升了词汇翻译性能?
- RQ4图像-文本对齐的质量在不同语言和词类中如何影响模型性能?
- RQ5词语频率和数据稀疏性对多模态任务中模型性能的影响如何?
主要发现
- 人类在填空任务中的表现较低:无图像提示时仅 21.89% 的缺失词语被正确猜中,且 42.41% 的尝试完全失败。
- 在词汇翻译任务中,仅使用文本的模型优于仅使用图像的模型,表明仅靠视觉信号对翻译性能的贡献极小。
- 多模态模型相较于仅使用图像的模型表现出一致的性能提升,但增益有限,最佳情况下 ALI 分数从 0.19 提升至 0.81(德语,intersect=4)。
- 仅使用文本的模型在除 intersect=4 最高设置外的所有情况下,ALI 分数均高于所有神经网络多模态模型,表明当前模型未能有效利用视觉信号。
- 即使对人类而言,填空任务也极具挑战性,表明该数据集捕捉到了复杂的真实世界语言与视觉对齐难题。
- 数据集构建方法成功利用 BabelNet 和跨语言对齐技术,在多种语言间消除了词语义歧义,实现了对消歧后语义的准确图像选择。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。