Skip to main content
QUICK REVIEW

[论文解读] DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset

Youngjun Lee, Byungsoo Ko|arXiv (Cornell University)|Dec 8, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出 DialogCC,一个通过基于 CLIP 相似度的自动化流水线创建的大规模多模态对话数据集,该流水线利用 CLIP 基于语义相似度将对话与图像匹配。该数据集显著提升了模型的泛化能力,在图像和文本检索任务中达到最先进性能,多样化的多图像对话增强了模型对图像和文本扰动的鲁棒性。

ABSTRACT

As sharing images in an instant message is a crucial factor, there has been active research on learning an image-text multi-modal dialogue models. However, training a well-generalized multi-modal dialogue model remains challenging due to the low quality and limited diversity of images per dialogue in existing multi-modal dialogue datasets. In this paper, we propose an automated pipeline to construct a multi-modal dialogue dataset, ensuring both dialogue quality and image diversity without requiring minimum human effort. In our pipeline, to guarantee the coherence between images and dialogue, we prompt GPT-4 to infer potential image-sharing moments - specifically, the utterance, speaker, rationale, and image description. Furthermore, we leverage CLIP similarity to maintain consistency between aligned multiple images to the utterance. Through this pipeline, we introduce DialogCC, a high-quality and diverse multi-modal dialogue dataset that surpasses existing datasets in terms of quality and diversity in human evaluation. Our comprehensive experiments highlight that when multi-modal dialogue models are trained using our dataset, their generalization performance on unseen dialogue datasets is significantly enhanced. We make our source code and dataset publicly available.

研究动机与目标

  • 为解决现有多模态对话数据集存在的规模小、主题多样性有限以及每条对话图像数量少的问题。
  • 开发一种无需人工标注的自动化、可扩展的流水线,用于创建高质量的多模态对话数据集。
  • 通过在每条对话话语中使用多个多样化图像进行训练,提升模型的泛化能力。
  • 证明在 DialogCC 上微调的模型可在图像和文本检索基准上实现卓越性能与鲁棒性。

提出的方法

  • 该流水线利用 CLIP 嵌入,基于语义相似度自动将纯文本对话中的话语与 CC3M 数据集中的相关图像匹配。
  • 采用两阶段过滤:源数据过滤以去除低质量对话,多模态对话过滤以确保图像与对话的相关性。
  • 该方法利用预训练的 CLIP 编码器提取文本和图像特征,实现无需人工参与的零样本匹配。
  • 最终数据集 DialogCC 包含超过 100 万条对话,平均每条对话包含 5.5 张图像,涵盖多样化主题与对话技能。
  • 通过在多种模态上选择与对话语义内容匹配的图像,确保数据集的高多样性。
  • 该数据集已公开发布,以支持开放域多模态对话系统的研究。

实验结果

研究问题

  • RQ1基于 CLIP 相似度的自动化流水线能否有效创建大规模、多样化且高质量的多模态对话数据集?
  • RQ2与每条对话仅包含单张或少量图像的数据集相比,在每条话语中使用多张图像进行训练是否能提升模型的泛化能力和鲁棒性?
  • RQ3在 DialogCC 上微调的模型能否在图像和文本检索任务中达到最先进性能?
  • RQ4在图像和文本增强条件下,DialogCC 训练的模型表现如何,体现其对输入变化的鲁棒性?
  • RQ5DialogCC 在多大程度上通过减少对固定图像-话语对的依赖,降低了记忆化风险?

主要发现

  • DialogCC 包含超过 100 万条对话和超过 550 万对图像-对话,其规模与多样性显著优于现有数据集。
  • 与 MMDD 和 PhotoChat 相比,该数据集涵盖 1.5 倍以上的唯一词汇和 2.5 倍以上的唯一上位词,表明主题与领域多样性更优。
  • 在 DialogCC 上训练的模型在图像和文本检索基准上均达到最先进性能,PhotoChat 数据集上的 Recall@1 达到 7.58%。
  • 在同义词替换的文本增强下,DialogCC 训练的模型 Recall@1 仅下降 1.85%,而基线模型下降 2.13%,表明其对图像增强具有更优鲁棒性。
  • 将每条话语的最大图像数量从 1 增加到 10,可使 R@1 提升 1.08 个百分点,R@10 提升 1.75 个百分点,证明多图像训练具有显著优势。
  • DialogCC 训练的模型在图像失真(如剪切、模糊)条件下表现出更低的性能下降,表明其对输入变化具有更强的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。