[论文解读] Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards
本文提出了一种用于无配对跨语言图像字幕生成的自监督强化学习框架,无需配对训练数据即可显著提升字幕的流畅性与视觉相关性。通过利用单语语料库学习流畅性奖励,并采用多层级视觉语义匹配模型计算视觉相关性奖励,该方法在英语和中文图像字幕基准测试中显著优于先前的最先进方法。
Generating image descriptions in different languages is essential to satisfy users worldwide. However, it is prohibitively expensive to collect large-scale paired image-caption dataset for every target language which is critical for training descent image captioning models. Previous works tackle the unpaired cross-lingual image captioning problem through a pivot language, which is with the help of paired image-caption data in the pivot language and pivot-to-target machine translation models. However, such language-pivoted approach suffers from inaccuracy brought by the pivot-to-target translation, including disfluency and visual irrelevancy errors. In this paper, we propose to generate cross-lingual image captions with self-supervised rewards in the reinforcement learning framework to alleviate these two types of errors. We employ self-supervision from mono-lingual corpus in the target language to provide fluency reward, and propose a multi-level visual semantic matching model to provide both sentence-level and concept-level visual relevancy rewards. We conduct extensive experiments for unpaired cross-lingual image captioning in both English and Chinese respectively on two widely used image caption corpora. The proposed approach achieves significant performance improvement over state-of-the-art methods.
研究动机与目标
- 解决在目标语言缺乏大规模配对图像-字幕数据集时生成高质量跨语言图像字幕的挑战。
- 缓解语言-枢纽式字幕生成流程中,通过枢纽语言到目标语言机器翻译引入的不流畅与视觉无关错误。
- 开发一种强化学习框架,利用自监督信号在无并行训练数据的情况下指导字幕生成。
- 通过来自单语文本和伪并行图像-字幕对的流畅性与视觉相关性奖励,提升字幕质量。
提出的方法
- 通过在目标语言单语语料库上进行自监督预训练,利用语言模型学习流畅性奖励。
- 提出一种多层级视觉语义匹配模型(ML-VSE),用于计算句子级与概念级的视觉相关性奖励。
- ML-VSE 模型在由枢纽语言到目标语言的翻译模型生成的伪并行图像-字幕对上进行训练。
- 将奖励函数整合进强化学习框架,以端到端方式优化字幕生成器。
- 通过联合优化自监督的流畅性与视觉相关性信号,减少对并行数据的依赖。
- 在 MSCOCO 和 AIC-ICC 数据集上对英语和中文字幕生成任务进行了框架评估。
实验结果
研究问题
- RQ1自监督奖励是否能在无并行训练数据的情况下提升跨语言图像字幕的流畅性?
- RQ2多层级视觉语义匹配是否能有效减少翻译后字幕中的视觉无关性?
- RQ3所提方法在无配对跨语言字幕生成中,与监督方法及先前无监督基线相比表现如何?
- RQ4来自域外来源的单语语料在多大程度上仍能改善字幕质量?
主要发现
- 所提方法在英语和中文无配对图像字幕任务中均达到最先进性能,在所有标准指标上均优于先前方法。
- 在 MSCOCO 测试集上,模型的 CIDEr 得分为 28.2,Meteor 得分为 14.2,显著优于基线模型。
- 人工评估显示流畅性得分为 4.8,相关性得分为 3.8,表明字幕质量有显著提升。
- 尽管使用零组并行训练数据,该模型性能与在 4,000 个配对样本上训练的监督模型相当。
- 即使使用域外单语语料,语言模型仍能提升字幕质量,展现出强大的泛化能力。
- 多层级视觉语义匹配模型有效捕捉了粗粒度与细粒度的视觉-文本对齐,如概念检索结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。