Skip to main content
QUICK REVIEW

[论文解读] MMChat: Multi-Modal Chat Dataset on Social Media

Yinhe Zheng, Guanyi Chen|arXiv (Cornell University)|Aug 16, 2021
Multimodal Machine Learning Applications参考文献 21被引用 8
一句话总结

本文提出 MMChat,一个大规模中文多模态对话数据集(3240万条原始对话,12.084万条过滤后数据),数据来源于真实的社交媒体对话,捕捉了图像引导话题与视觉内容脱节的‘稀疏性’现象。作者提出一种基准模型,通过在图像特征上使用注意力路由机制来处理稀疏性,结果表明引入视觉特征可提升对话生成性能,尤其在高质量的 MMChat-hf 子集上(1.99万条对话)。

ABSTRACT

Incorporating multi-modal contexts in conversation is important for developing more engaging dialogue systems. In this work, we explore this direction by introducing MMChat: a large-scale Chinese multi-modal dialogue corpus (32.4M raw dialogues and 120.84K filtered dialogues). Unlike previous corpora that are crowd-sourced or collected from fictitious movies, MMChat contains image-grounded dialogues collected from real conversations on social media, in which the sparsity issue is observed. Specifically, image-initiated dialogues in common communications may deviate to some non-image-grounded topics as the conversation proceeds. To better investigate this issue, we manually annotate 100K dialogues from MMChat and further filter the corpus accordingly, which yields MMChat-hf. We develop a benchmark model to address the sparsity issue in dialogue generation tasks by adapting the attention routing mechanism on image features. Experiments demonstrate the usefulness of incorporating image features and the effectiveness of handling the sparsity of image features.

研究动机与目标

  • 为解决缺乏反映社交媒体对话中图像引导话题自然漂移的现实、真实世界多模态对话数据集的问题。
  • 探究多模态对话系统中的‘稀疏性’问题,即并非所有对话轮次都基于视觉输入。
  • 通过人工标注构建高质量、过滤后的数据集(MMChat-hf),以支持多模态对话模型的稳健评估。
  • 开发一种显式建模图像特征稀疏性的基准模型,以提升对话生成性能。
  • 推动多模态预训练研究、中文交流的社会科学研究,以及对话系统中偏见与毒性问题的缓解。

提出的方法

  • 从一个中文社交媒体平台收集了3240万条原始对话会话和841万张图像,尊重用户隐私与公开可见性。
  • 应用自动过滤管道去除不连贯、冒犯性或无关的对话与图像,最终得到 MMChat(12.084万条对话,20.432万张图像)。
  • 从 MMChat 中选取10万条对话进行人工标注,生成 MMChat-hf(1.99万条对话,5.224万张图像),确保文本与图像之间具有高度相关性。
  • 通过预训练图像字幕模型生成图像字幕和物体标签,以增强每张图像的视觉上下文信息。
  • 提出基准模型 Seq2Seq+IMG,将注意力路由机制适配至动态关注相关图像特征,以应对稀疏性问题。
  • 在 MMChat 和 MMChat-hf 上训练并评估模型,与仅使用文本的基线模型及使用预提取图像特征的模型(Seq2Seq+PIMG)进行性能对比。

实验结果

研究问题

  • RQ1在真实社交媒体对话中,图像稀疏性现象有多普遍,即对话话题是否从初始视觉触发点发生漂移?
  • RQ2在真实、稀疏的多模态设置下,引入视觉特征在开放域对话生成中的性能提升程度如何?
  • RQ3显式建模图像特征稀疏性的模型是否能优于将所有图像特征一视同仁处理的模型?
  • RQ4对对话和图像进行人工筛选如何影响多模态对话生成中模型的性能与多样性?
  • RQ5数据集质量(原始 vs. 过滤后)对对话生成任务中 BLEU 和多样性分数的影响是什么?

主要发现

  • 在 MMChat-hf 数据集上,所提出的 Seq2Seq+IMG 模型相比仅使用文本的 Seq2Seq 基线,BLEU-4 分数相对提升了54.84%。
  • 在 MMChat 数据集上,该模型相比基线 BLEU-4 提升了24.97%,表明即使在过滤程度较低的数据中,视觉特征也能有效提升生成性能。
  • 人工筛选的 MMChat-hf 子集在 BLEU 和多样性分数上均持续优于原始 MMChat,表明数据质量对模型性能有显著影响。
  • 注意力路由机制有效应对了稀疏性问题,Seq2Seq+IMG 表现优于 Seq2Seq+PIMG,证明显式建模稀疏性可提升性能。
  • 尽管 BLEU 分数有所提升,但多样性增益(多样性分数)有限,可能是因为视觉上下文对响应生成具有较强约束作用。
  • 数据集发布仅包含原始对话和图像的 URL,不包含原始内容,以保护隐私,并支持在严格条款下的学术使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。