Skip to main content
QUICK REVIEW

[论文解读] OpenViDial 2.0: A Larger-Scale, Open-Domain Dialogue Generation Dataset with Visual Contexts

Shuhe Wang, Yuxian Meng|arXiv (Cornell University)|Sep 27, 2021
Multimodal Machine Learning Applications参考文献 71被引用 5
一句话总结

OpenViDial 2.0 是一个大规模、开放领域的多模态对话数据集,包含 560 万个与电影和电视剧中提取的视觉情境配对的对话轮次。它在 OpenViDial 1.0 的基础上将数据集规模扩大四倍,显著提升了多模态对话生成和多模态预训练模型的训练效果。

ABSTRACT

In order to better simulate the real human conversation process, models need to generate dialogue utterances based on not only preceding textual contexts but also visual contexts. However, with the development of multi-modal dialogue learning, the dataset scale gradually becomes a bottleneck. In this report, we release OpenViDial 2.0, a larger-scale open-domain multi-modal dialogue dataset compared to the previous version OpenViDial 1.0. OpenViDial 2.0 contains a total number of 5.6 million dialogue turns extracted from either movies or TV series from different resources, and each dialogue turn is paired with its corresponding visual context. We hope this large-scale dataset can help facilitate future researches on open-domain multi-modal dialog generation, e.g., multi-modal pretraining for dialogue generation.

研究动机与目标

  • 解决因数据集规模有限而导致的多模态对话学习瓶颈问题。
  • 通过结合文本对话历史与视觉上下文,提升对话生成的真实性。
  • 提供一个可扩展的、开放获取的数据集,以支持多模态预训练和端到端对话生成的研究。
  • 促进能够联合推理文本与视觉模态的模型在开放领域对话中的发展。
  • 在原始 OpenViDial 1.0 数据集的基础上,将对话轮次数量扩展四倍,并提供对齐的视觉上下文。

提出的方法

  • 从多个公开来源的电影和电视剧中提取对话轮次及其对应的视觉帧。
  • 将每个对话话语与其发生的视觉上下文(图像帧)进行对齐,确保时间与语义的一致性。
  • 对数据集进行筛选与验证,确保话语与视觉输入之间的高质量配对。
  • 沿用 OpenViDial 1.0 的数据采集流程,但扩展至包含 560 万个对话轮次。
  • 保持数据集的开放领域特性,以支持多样化、非任务特定的对话生成。
  • 通过 GitHub 公开发布数据集,以促进可复现性与社区使用。

实验结果

研究问题

  • RQ1一个显著更大规模的多模态对话数据集是否能提升开放领域对话生成模型的性能?
  • RQ2视觉上下文在多大程度上提升了开放领域对话中生成回复的连贯性、多样性与相关性?
  • RQ3将数据集从 110 万个轮次扩展到 560 万个轮次,对多模态对话模型的泛化能力与鲁棒性有何影响?
  • RQ4在大规模下收集与对齐高质量的视觉与文本对话数据面临哪些关键挑战?
  • RQ5所提出的数据集能否作为对话系统中多模态预训练的强大基础?

主要发现

  • OpenViDial 2.0 包含 560 万个与对应视觉上下文配对的对话轮次,相比 OpenViDial 1.0 扩大了四倍。
  • 该数据集源自多样化的电影与电视剧内容,确保了广泛的语言与视觉多样性。
  • 每个对话轮次均与源视觉帧在时间与语义上实现对齐,支持有效的多模态建模。
  • 该数据集支持多模态对话生成模型的训练与评估,尤其适用于利用视觉上下文的模型。
  • OpenViDial 2.0 的发布为未来多模态对话系统研究提供了可扩展的基准。
  • 该数据集可在 https://github.com/ShannonAI/OpenViDial 公开获取,支持开放与可复现的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。