[论文解读] COCO-CN for Cross-Lingual Image Tagging, Captioning and Retrieval
本文介绍了 COCO-CN,一个大规模多语言数据集,通过增加 27,218 条人工撰写的中文图像描述和 70,993 个标签,扩展了 MS-COCO,实现了跨语言图像标记、描述和检索。该研究提出了一种推荐辅助标注系统,以提高标注质量和效率,并利用级联 MLP 和增强的 W2VV 模型建立了强大的基线,其在跨语言任务上的表现优于单语和商业方法。
This paper contributes to cross-lingual image annotation and retrieval in terms of data and baseline methods. We propose COCO-CN, a novel dataset enriching MS-COCO with manually written Chinese sentences and tags. For more effective annotation acquisition, we develop a recommendation-assisted collective annotation system, automatically providing an annotator with several tags and sentences deemed to be relevant with respect to the pictorial content. Having 20,342 images annotated with 27,218 Chinese sentences and 70,993 tags, COCO-CN is currently the largest Chinese-English dataset that provides a unified and challenging platform for cross-lingual image tagging, captioning and retrieval. We develop conceptually simple yet effective methods per task for learning from cross-lingual resources. Extensive experiments on the three tasks justify the viability of the proposed dataset and methods. Data and code are publicly available at https://github.com/li-xirong/coco-cn
研究动机与目标
- 为解决非英语语言(尤其是中文)缺乏高质量、大规模多语言图像数据集的问题。
- 通过开发一种推荐辅助集体标注系统,提高图像标注的质量和效率。
- 利用双语资源,建立有效的跨语言图像标记、描述和检索模型。
- 为跨语言多媒体理解在多个任务上的评估提供统一基准。
提出的方法
- 开发了一种推荐辅助集体标注系统,基于图像内容向标注者推荐相关标签和句子,降低工作量并提高一致性。
- 收集了 20,342 幅图像,包含 27,218 条中文描述和 70,993 个标签,显著扩展了 MS-COCO,提供了多样化且高质量的双语标注。
- 提出了一种级联 MLP 模型,利用单语和双语数据提升跨语言图像标记性能。
- 提出了一种增强的 W2VV 模型用于跨语言图像检索,整合了跨语言的视觉与文本特征。
- 通过词袋特征融合,将标签作为额外输入引入图像描述生成,提升了生成质量。
- 使用标准指标在三个任务上评估模型:图像标记(精确率、召回率、F1)、描述生成(BLEU-4、METEOR、ROUGE-L、CIDEr)和检索(CL、CM、CLM)。
实验结果
研究问题
- RQ1推荐辅助标注系统是否能显著提升多语言图像标注的质量和效率?
- RQ2在跨语言图像标记和描述任务中,双语标签和句子的引入对性能有何影响?
- RQ3从单语和双语数据中进行级联学习,是否能优于在单语数据上端到端训练的模型,用于跨语言图像标记?
- RQ4在跨语言设置下,将标签作为辅助输入是否能提升图像描述生成性能?
- RQ5增强的 W2VV 模型在跨语言图像检索中与现有方法相比表现如何?
主要发现
- 推荐辅助系统在建议标签中的接受率达到 54%,显著降低了标注者的工作量,同时保持了高质量的标注。
- 级联 MLP 在跨语言图像标记任务中优于单语和多任务模型,证明了从多语言数据中分步学习的有效性。
- 结合标签特征的图像描述生成模型取得了 90.0 的 CIDEr 得分,较基线(84.6)提升了 5.4 分,证明标签能有效提升描述质量。
- 增强的 W2VV 模型在跨语言图像检索任务中达到了最先进性能,优于单语和商业基线模型。
- COCO-CN 包含 585 个超出 MS-COCO 的新概念,且每句话的关键词数量比机器翻译高出 45.3%,表明其具有丰富的语言多样性。
- ResNeXt-101 特征在所有三项任务中均表现最佳,证实其在跨语言表示学习中的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。