[论文解读] Unsupervised Cross-lingual Image Captioning.
本文提出了一种无监督跨语言图像字幕生成方法,可在无需目标语言(以中文为例)图像-字幕配对数据的情况下,生成目标语言的字幕。该方法利用跨语言场景图到句子的翻译以及无监督跨模态特征对齐,仅通过平行句子语料库,将图像生成的场景图与目标语言句子对齐。
Research in image captioning has mostly focused on English because of the availability of image-caption paired datasets in this language. However, building vision-language systems only for English deprives a large part of the world population of AI technologies' benefit. On the other hand, creating image-caption paired datasets for every target language is expensive. In this work, we present a novel unsupervised cross-lingual method to generate image captions in a target language without using any image-caption corpus in the source or target languages. Our method relies on (i) a cross-lingual scene graph to sentence translation process, which learns to decode sentences in the target language from a cross-lingual encoding space of scene graphs using a sentence parallel (bitext) corpus, and (ii) an unsupervised cross-modal feature mapping which seeks to map an encoded scene graph features from image modality to language modality. We verify the effectiveness of our proposed method on the Chinese image caption generation task. The comparisons against several existing methods demonstrate the effectiveness of our approach.
研究动机与目标
- 在不依赖目标语言图像-字幕配对数据的前提下,实现低资源语言(如中文)的图像字幕生成。
- 解决现有图像字幕系统主要依赖英语单语数据集训练的局限性。
- 开发一种仅利用平行句子语料库和跨语言场景图表示的零样本跨语言字幕生成方法。
- 在无监督条件下弥合视觉场景图与目标语言句子之间的模态差距。
提出的方法
- 该方法采用跨语言场景图到句子的翻译过程,利用平行句子(双语语料)将场景图映射为目标语言的句子。
- 提出一种无监督跨模态特征映射,将图像模态生成的场景图特征与语言模态的特征对齐。
- 模型学习从共享的跨语言场景图编码空间解码目标语言句子,从而实现在低资源语言上的零样本迁移。
- 依赖预训练视觉模型从图像中提取场景图,以及多语言语言模型在目标语言中生成句子。
- 该方法无需目标语言的任何图像-字幕对,仅依赖跨语言句子对齐与视觉特征映射。
- 框架通过对比学习端到端训练,以对齐视觉场景图与其在目标语言中的对应句子表征。
实验结果
研究问题
- RQ1在目标语言中完全无图像-字幕配对数据的情况下,能否有效实现图像字幕生成?
- RQ2跨语言场景图表示在零样本字幕生成中,能否有效弥合视觉与语言模态之间的差距?
- RQ3无监督跨模态特征映射在低资源设置下,能在多大程度上提升字幕质量?
- RQ4仅结合视觉场景图,平行句子语料库是否足以实现高质量的跨语言字幕生成?
主要发现
- 尽管在中文中未使用任何图像-字幕配对数据进行训练,该方法在中文图像字幕任务上仍取得了具有竞争力的性能。
- 无监督跨模态特征映射显著提升了视觉场景图与目标语言句子之间的对齐效果。
- 跨语言场景图到句子的翻译过程能够准确生成流畅且语境相关的字幕。
- 该方法在中文图像字幕任务上优于现有的零样本与无监督基线模型,证明了其在低资源设置下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。