Skip to main content
QUICK REVIEW

[论文解读] Multimodal Interactions Using Pretrained Unimodal Models for SIMMC 2.0

Joosung Lee, Kijong Han|arXiv (Cornell University)|Dec 10, 2021
Topic Modeling被引用 4
一句话总结

本文提出了一种多模态框架,通过微调预训练的单模态模型(RoBERTa 和 DeIT)来实现 SIMMC 2.0 挑战中的多模态理解。该框架引入了两项预训练任务——图像到文本匹配(ITM)和背景到文本匹配(BTM),以对齐视觉与文本表征,在子任务 #1 和 #2 中获得第三名,在子任务 #4 生成任务中获得第二名,F1 得分为 68.2,BLEU-4 得分为 0.297。

ABSTRACT

This paper presents our work on the Situated Interactive MultiModal Conversations 2.0 challenge held at Dialog State Tracking Challenge 10. SIMMC 2.0 includes 4 subtasks, and we introduce our multimodal approaches for the subtask \#1, \#2 and the generation of subtask \#4. SIMMC 2.0 dataset is a multimodal dataset containing image and text information, which is more challenging than the problem of only text-based conversations because it must be solved by understanding the relationship between image and text. Therefore, since there is a limit to solving only text models such as BERT or GPT2, we propose a multimodal model combining image and text. We first pretrain the multimodal model to understand the relationship between image and text, then finetune our model for each task. We achieve the 3rd best performance in subtask \#1, \#2 and a runner-up in the generation of subtask \#4. The source code is available at https://github.com/rungjoo/simmc2.0.

研究动机与目标

  • 为解决任务导向对话中图像与文本均对准确推理至关重要的多模态理解挑战。
  • 克服单模态模型(如 BERT、GPT2)在处理复杂现实场景(如时尚/家具购物)中的视觉-语言关系时的局限性。
  • 通过利用联合视觉-文本表征,提升多模态对话任务(包括消歧、共指消解、对话状态追踪和响应生成)的性能。
  • 验证在图像-文本对齐和多任务学习上进行预训练对下游多模态 NLP 任务的有效性。

提出的方法

  • 使用两种对比学习目标预训练多模态模型:图像到文本匹配(ITM)用于实现对象级别的视觉-文本对齐,背景到文本匹配(BTM)用于实现场景级别的上下文理解。
  • 在 SIMMC 2.0 的四个子任务上微调预训练的多模态模型,使用特定任务的头结构和共享表征。
  • 整合来自 DeIT(可变形图像变换器)的视觉特征和来自 RoBERTa-Large 的文本特征,以支持跨模态注意力与交互。
  • 在子任务 #2 中采用多任务学习,联合优化对象共指和话语分类,以提升泛化能力并过滤候选对象。
  • 将槽值和对象图像表征融入 GPT2 用于响应生成,以增强事实一致性和相关性。
  • 通过消融研究评估 ITM、BTM、系统话语数据以及多任务组件在各子任务中的贡献。

实验结果

研究问题

  • RQ1预训练的单模态模型(RoBERTa 和 DeIT)能否被有效结合以提升对话系统中的多模态推理能力?
  • RQ2在图像-文本匹配(ITM)和背景-文本匹配(BTM)上进行预训练,在提升下游多模态对话性能方面有多有效?
  • RQ3多任务学习组件(如话语分类、系统匹配)在多大程度上能改善共指消解和消歧?
  • RQ4视觉特征(对象和背景图像)以及元数据(槽值)在多模态对话中对响应生成质量有何贡献?
  • RQ5不同训练组件(如系统话语数据、对象图像)对各子任务模型性能的相对影响如何?

主要发现

  • 所提模型在子任务 #1(多模态消歧)中取得第三名,测试准确率达 93.1%,显著优于 GPT2 基线(73.5%)。
  • 在子任务 #2(多模态共指消解)中,模型测试 F1 得分为 68.2,远超基线(44.1 F1)和最佳基线('all S' 策略为 32.2 F1)。
  • 消融研究显示,将系统话语数据作为训练输入可使性能提升 +1.2 F1,表明其具有显著的数据增强效益。
  • 在响应生成中引入槽值使 BLEU-4 提升 +0.01,凸显其在将响应与视觉及对话上下文对齐中的重要性。
  • 多任务学习使子任务 #2 的性能提升 +1.6 F1,其中话语分类准确率达 99.5%,系统匹配 F1 达 93.24。
  • 在子任务 #4(响应生成)中,模型 BLEU-4 得分为 0.297,排名第二,显著受益于对象表征与槽值的结合。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。