[论文解读] Multimodal Conditionality for Natural Language Generation
该论文提出MAnTiS,一种用于在多种模态(如图像和文本)条件下对基于Transformer的文本生成模型进行条件化的方法。通过分别编码每种模态,将其投影到语言模型的标记空间,并将它们组合成一种模态感知的前缀,MAnTiS在不修改预训练模型架构的前提下,实现了高质量的多模态文本生成,其在自动评估和人工评估指标上均优于强基线模型。
Large scale pretrained language models have demonstrated state-of-the-art performance in language understanding tasks. Their application has recently expanded into multimodality learning, leading to improved representations combining vision and language. However, progress in adapting language models towards conditional Natural Language Generation (NLG) has been limited to a single modality, generally text. We propose MAnTiS, Multimodal Adaptation for Text Synthesis, a general approach for multimodal conditionality in transformer-based NLG models. In this method, we pass inputs from each modality through modality-specific encoders, project to textual token space, and finally join to form a conditionality prefix. We fine-tune the pretrained language model and encoders with the conditionality prefix guiding the generation. We apply MAnTiS to the task of product description generation, conditioning a network on both product images and titles to generate descriptive text. We demonstrate that MAnTiS outperforms strong baseline approaches on standard NLG scoring metrics. Furthermore, qualitative assessments demonstrate that MAnTiS can generate human quality descriptions consistent with given multimodal inputs.
研究动机与目标
- 解决将预训练语言模型适配于使用多种模态进行条件化文本生成的空白。
- 开发一种方法,在保留预训练模型生成能力的同时,实现对图像和文本等多样化输入的条件化。
- 提供一种通用、模块化且可扩展的多模态NLG框架,避免对预训练模型架构进行修改。
- 评估在真实世界电商产品描述生成任务中,多模态条件化的有效性。
提出的方法
- 每种模态(如图像和文本)通过其特定的编码器处理,生成嵌入表示。
- 将图像和文本的嵌入表示投影到预训练语言模型的文本标记空间中。
- 将投影后的嵌入表示与分隔符标记连接,形成条件性前缀。
- 将该前缀作为上下文输入解码器,模型在保持语言模型结构不变的前提下,自回归地生成文本。
- 仅对生成的文本标记使用标准语言建模范式,对模型进行端到端微调。
- 该方法支持多个图像输入,并可引入模态丢弃以提升鲁棒性。
实验结果
研究问题
- RQ1是否可以在不修改架构的前提下,有效利用多种模态(如图像和文本)对预训练语言模型进行条件化,以实现自然语言生成?
- RQ2通过模态特定前缀实现的多模态条件化,与将条件向量注入模型注意力层的方法相比,表现如何?
- RQ3在每个产品中使用多个图像是否能提升生成描述的质量和相关性?
- RQ4在训练过程中使用模态丢弃是否能提升泛化能力而不降低性能?
- RQ5与基线模型相比,人工评估者如何评价MAnTiS生成描述的语法正确性、连贯性和吸引力?
主要发现
- 当使用最多五个图像时,MAnTiS在所有标准NLG指标上均优于强基线模型,包括BLEU4(+0.1)、CIDEr(+2.2)、METEOR(+0.3)和ROUGE-L(+0.3)。
- 人工评估显示,MAnTiS生成的描述在语法、非冗余性、一致性和吸引力方面得分显著更高,整体平均评分为5分制中的4.2分。
- 该模型生成的描述能够准确突出图像中的特定特征,例如“饰有刺绣流苏”,表明实现了准确的视觉定位。
- 引入多个图像提升了性能,表明模型能够有效融合来自不同视角的视觉信息。
- 模态丢弃略微提升了BLEU4和CIDEr得分,表明其在不产生负面影响的前提下增强了模型鲁棒性。
- MAnTiS-scratch(从零开始训练)显著低于MAnTiS-single的表现,证实了利用大规模预训练语言模型的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。