Skip to main content
QUICK REVIEW

[论文解读] Generative Visual Dialogue System via Adaptive Reasoning and Weighted Likelihood Estimation

Heming Zhang, Shalini Ghosh|arXiv (Cornell University)|Feb 26, 2019
Multimodal Machine Learning Applications参考文献 28被引用 7
一句话总结

该论文提出了一种基于加权似然估计(WLE)和自适应多模态推理模块的生成式视觉对话系统,以提升响应的多样性与上下文相关性。通过在训练过程中同时利用正样本和负样本响应,并动态选择相关的图像与对话特征,该模型在VisDial基准上实现了最先进性能,相较于以往的生成式方法,召回率@10提升了5.81%。

ABSTRACT

The key challenge of generative Visual Dialogue (VD) systems is to respond to human queries with informative answers in natural and contiguous conversation flow. Traditional Maximum Likelihood Estimation (MLE)-based methods only learn from positive responses but ignore the negative responses, and consequently tend to yield safe or generic responses. To address this issue, we propose a novel training scheme in conjunction with weighted likelihood estimation (WLE) method. Furthermore, an adaptive multi-modal reasoning module is designed, to accommodate various dialogue scenarios automatically and select relevant information accordingly. The experimental results on the VisDial benchmark demonstrate the superiority of our proposed algorithm over other state-of-the-art approaches, with an improvement of 5.81% on recall@10.

研究动机与目标

  • 解决最大似然估计(MLE)在生成式视觉对话系统中的局限性,该方法因过度拟合于高频答案而生成通用或安全的响应。
  • 通过在训练过程中利用正样本和负样本响应(而非忽略负样本),提升响应的多样性与相关性。
  • 设计一种推理模块,能够根据当前对话上下文动态调整多模态输入(图像、问题、对话历史)的处理顺序,而非依赖固定的序列路径。
  • 通过提升生成响应的质量与多样性,缩小生成式与判别式视觉对话模型之间的性能差距。
  • 在VisDial基准上展示最先进性能,尤其在召回率与平均排名指标上,适用于v0.9与v1.0两种评估设置。

提出的方法

  • 提出一种基于加权似然估计(WLE)的训练方案,根据正样本与负样本响应为每个样本分配特定权重,增强模型泛化能力并减少对通用答案的过度依赖。
  • 引入一种自适应多模态推理模块,利用无约束注意力机制,根据当前上下文动态选择并关注相关的图像区域、问题与对话历史。
  • 将WLE训练方案与分层编码器-解码器架构相结合,使用ResNet和预训练语言模型的特征表示图像与文本输入。
  • 在解码器中采用双注意力机制,同时关注图像特征与对话历史,实现上下文感知的响应生成。
  • 使用交叉熵损失端到端训练模型,样本权重由一个学习得到的权重函数决定,综合考虑响应质量与多样性。
  • 通过消融研究验证WLE与自适应推理模块的贡献,与MLE、GAN及标准HCIAE基线模型进行比较。

实验结果

研究问题

  • RQ1在训练过程中引入负样本响应,是否能相比标准MLE提升视觉对话系统生成答案的多样性与具体性?
  • RQ2一种能够动态选择多模态输入处理顺序的自适应推理机制,是否在复杂对话场景中优于固定顺序推理?
  • RQ3加权似然估计(WLE)训练方案是否能显著提升生成式视觉对话性能,特别是在召回率@10与平均排名等指标上?
  • RQ4在标准化评估协议下,该方法与VisDial基准上的最先进生成式与判别式模型相比表现如何?
  • RQ5模型性能在多大程度上依赖于推理模块而非训练目标?两者是否可独立验证?

主要发现

  • 所提出的基于WLE的训练方案在VisDial v0.9上相较之前最佳生成模型(CoAtt)将召回率@10提升5.81%,平均排名提升5.28分。
  • 在VisDial v1.0上,该模型在10个模型中排名第六,尽管是唯一进入前十的生成式模型,充分证明了其鲁棒性与泛化能力。
  • 消融研究显示,将WLE应用于HCIAE主干网络时,相比MLE提升召回率@10达6.35%,相比GAN提升4.04%,表明WLE在效果上优于对抗训练。
  • 自适应推理模块相比固定顺序基线模型(如HCIAE)在召回率@5上提升1.47%,在召回率@10上提升3.47%,在平均排名上提升5.08分,显示出其在上下文感知推理中的显著影响。
  • 定性结果表明,该模型生成的响应更具具体性与人类自然语言特征,注意力热力图也证实其对相关图像区域实现了动态且上下文依赖的关注。
  • v0.9上R@1得分较低的原因在于评估方案更偏好单一人工标注答案,而该模型在将多个正确答案排在高位方面表现优异,这一优势通过前十名响应分析得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。