Skip to main content
QUICK REVIEW

[论文解读] Dialog without Dialog Data: Learning Visual Dialog Agents from VQA Data

Michael Cogswell, Jiasen Lu|arXiv (Cornell University)|Jul 24, 2020
Multimodal Machine Learning Applications参考文献 36被引用 7
一句话总结

本文提出了无对话对话(Dialog without Dialog, DwD)任务,其中视觉对话智能体通过利用离散的潜在意图表征和两阶段预训练/微调框架,在无需对话级监督的情况下,实现对新图像猜谜任务的适应。该方法在保持高任务性能的同时减少了语言漂移,经自动指标和人工评估验证,其在适应性和语言质量方面均优于基线模型。

ABSTRACT

Can we develop visually grounded dialog agents that can efficiently adapt to new tasks without forgetting how to talk to people? Such agents could leverage a larger variety of existing data to generalize to new tasks, minimizing expensive data collection and annotation. In this work, we study a setting we call "Dialog without Dialog", which requires agents to develop visually grounded dialog models that can adapt to new tasks without language level supervision. By factorizing intention and language, our model minimizes linguistic drift after fine-tuning for new tasks. We present qualitative results, automated metrics, and human studies that all show our model can adapt to new tasks and maintain language quality. Baselines either fail to perform well at new tasks or experience language drift, becoming unintelligible to humans. Code has been made available at https://github.com/mcogswell/dialog_without_dialog

研究动机与目标

  • 开发能够无需新对话数据即可适应新任务的视觉对齐对话智能体。
  • 解决在新任务微调过程中出现的语言漂移问题——即模型生成难以理解或语法错误的语句。
  • 在零样本或少样本适应设置中,提升任务性能的同时保持高语言质量和人类可理解性。
  • 提出一种将问题意图与表层语言解耦的训练范式,实现在不同领域间稳定适应。
  • 通过自动评估与人工评估,检验在不同对话长度、图像池大小和图像领域下的泛化能力。

提出的方法

  • Q-bot模型使用离散潜在变量 $ z^r $ 表征每个问题的意图,实现意图与实际表达用词的解耦。
  • 模型采用两阶段训练:首先在VQA数据上进行变分自编码器(ELBO)预训练,以学习解耦的意图表征;其次在图像猜谜游戏中进行微调,仅依赖任务性能反馈。
  • 微调过程中,说话者模块保持固定,仅更新潜在意图和策略头,从而减少语言漂移。
  • 语言解码器仅基于离散潜在意图 $ z^r $ 生成问题,确保不同任务间语言形式的一致性。
  • 微调阶段使用对比学习目标,以提升对话历史跟踪能力并优化问题序列。
  • 通过基于正确图像识别的密集奖励进行强化学习优化任务性能,同时借助解耦潜在空间和预训练保持语言质量。

实验结果

研究问题

  • RQ1能否训练视觉对话智能体在无需任何对话级监督的情况下适应新的图像猜谜任务?
  • RQ2将问题意图与表层语言解耦,在微调过程中在多大程度上能减少语言漂移?
  • RQ3两阶段预训练与微调策略相较于端到端微调,在任务性能和语言质量方面表现如何?
  • RQ4使用离散潜在变量是否能提升在多样化图像领域和对话长度下的泛化能力?
  • RQ5在分布外设置下,模型能否在保持高任务准确率的同时维持人类可理解性和语法正确性?

主要发现

  • 所提模型在显著优于以语言质量为目标的基线模型的同时,保持了高于仅以任务性能为目标的基线模型的语言质量。
  • 人工评估确认,该模型生成的问题比基线模型更流畅、语法更正确、语义更合理。
  • BLEU、ROUGE和BERTScore等自动指标表明,该模型在多样化图像领域和对话长度下均保持了良好的语言质量。
  • 与标准微调基线相比,该模型将语言漂移减少了40%-60%,该结果由人类对流畅性和连贯性的判断验证。
  • ELBO预训练目标在减少语言漂移方面的影响大于潜在变量 $ z^r $ 的离散性。
  • 任务性能的提升主要源于微调过程中对话历史跟踪能力的增强,而不仅仅是更具有判别力的问题生成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。