Skip to main content
QUICK REVIEW

[论文解读] Modeling Text-visual Mutual Dependency for Multi-modal Dialog Generation

Shuhe Wang, Yuxian Meng|arXiv (Cornell University)|May 30, 2021
Multimodal Machine Learning Applications参考文献 59被引用 11
一句话总结

本文提出了一种多模态对话生成框架,通过建模文本与视觉特征之间的相互依赖关系,生成上下文相关的对话。通过联合训练文本生成与视觉特征预测任务,该模型显著提升了相关性与人类对话的自然度,在OpenViDial数据集上实现了最先进性能,相比基线模型BLEU-4提升2.74%。

ABSTRACT

Multi-modal dialog modeling is of growing interest. In this work, we propose frameworks to resolve a specific case of multi-modal dialog generation that better mimics multi-modal dialog generation in the real world, where each dialog turn is associated with the visual context in which it takes place. Specifically, we propose to model the mutual dependency between text-visual features, where the model not only needs to learn the probability of generating the next dialog utterance given preceding dialog utterances and visual contexts, but also the probability of predicting the visual features in which a dialog utterance takes place, leading the generated dialog utterance specific to the visual context. We observe significant performance boosts over vanilla models when the mutual dependency between text and visual features is modeled. Code is available at https://github.com/ShannonAI/OpenViDial.

研究动机与目标

  • 解决现有多模态对话模型依赖静态单图视觉上下文而非时变视觉上下文的局限性。
  • 通过建模文本与视觉特征之间的相互依赖关系,提升对话生成质量,增强上下文特定的响应生成能力。
  • 评估细粒度视觉特征(物体级)与粗粒度特征(图像级)在多模态对话系统中的影响。
  • 验证在生成更自然、上下文相关对话响应时,引入视觉-文本相互信息(MI)的优势。

提出的方法

  • 模型采用编码器-解码器架构的序列到序列框架,整合来自CNN的不同粒度视觉特征:无视觉输入(NV)、图像级(CV)和物体级(FV)。
  • 引入相互依赖机制,使模型能够联合学习:在给定历史对话与视觉上下文的前提下生成下一句对话;以及从生成的对话中预测视觉特征。
  • 通过对比学习目标实现相互信息(MI)模块,对齐视觉与文本表征,提升特征对齐效果。
  • 采用交叉熵损失进行生成任务,采用对比损失进行视觉特征重建,实现端到端训练。
  • 通过训练判别器来区分人类撰写与模型生成的响应(基于拼接的文本与视觉特征)进行对抗性评估。
  • 通过众包方式进行人工评估,以衡量生成响应的相关性、多样性与可读性。

实验结果

研究问题

  • RQ1建模文本与视觉特征之间的相互依赖关系是否能提升多模态对话生成的质量?
  • RQ2视觉特征的粒度(图像级 vs. 物体级)如何影响响应的相关性与多样性?
  • RQ3能否通过从对话话语中联合预测视觉特征,实现更上下文特定且连贯的响应?
  • RQ4所提方法在自动评估、对抗性评估与人工评估中与基线视觉模型相比表现如何?

主要发现

  • FV+MI模型相比基线FV模型在BLEU-4上取得2.74%的绝对提升,证明了相互依赖建模的有效性。
  • FV+MI模型的对抗性成功率(0.877)优于基线FV模型(0.890),表明其生成响应更具人类自然度。
  • 人工评估显示,FV+MI模型在相关性、多样性和可读性方面显著优于FV与CV模型,p值均小于0.01。
  • FV模型在所有评估指标上显著优于CV与NV模型,证实细粒度视觉特征的优势。
  • MI策略在所有评估类型中均持续提升性能,表明相互信息建模能增强文本与视觉语义之间的对齐。
  • 定性分析表明,FV+MI能生成更丰富信息且上下文特定的响应,而NV与CV模型则产生通用或无关的对话。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。