Skip to main content
QUICK REVIEW

[论文解读] Neural Self Talk: Image Understanding via Continuous Questioning and Answering

Yezhou Yang, Yi Li|arXiv (Cornell University)|Dec 10, 2015
Multimodal Machine Learning Applications参考文献 32被引用 17
一句话总结

本文提出 Neural Self Talk 框架,通过深度学习实现图像的持续理解,方法为迭代生成问题并回答。该框架联合训练视觉问题生成(VQG)与视觉问答(VQA)模块,采用 RNN 与 CNN 模型,在评估中展现出类人的问题可读性与相关性,证明了通过自生成对话实现自主视觉推理的可行性。

ABSTRACT

In this paper we consider the problem of continuously discovering image contents by actively asking image based questions and subsequently answering the questions being asked. The key components include a Visual Question Generation (VQG) module and a Visual Question Answering module, in which Recurrent Neural Networks (RNN) and Convolutional Neural Network (CNN) are used. Given a dataset that contains images, questions and their answers, both modules are trained at the same time, with the difference being VQG uses the images as input and the corresponding questions as output, while VQA uses images and questions as input and the corresponding answers as output. We evaluate the self talk process subjectively using Amazon Mechanical Turk, which show effectiveness of the proposed method.

研究动机与目标

  • 通过自生成问题与答案的持续循环,实现自主图像理解。
  • 解决从图像中无须人工提供问题的开放性、非约束性问题生成挑战。
  • 通过端到端可训练的神经网络,闭合视觉感知与语言推理之间的语义闭环。
  • 以人性化方式评估自对话交互的质量与连贯性。
  • 探索自对话作为推动人工智能超越静态图像分类的潜在机制。

提出的方法

  • 使用基于 RNN 的序列模型训练视觉问题生成(VQG)模块,从图像中生成自然语言问题。
  • 使用双流 CNN-RNN 架构训练视觉问答(VQA)模块,从图像-问题对中生成答案。
  • 两个模块通过共享的图像表征联合训练,VQG 从同一视觉输入预测问题,VQA 预测答案。
  • 系统以循环方式执行推理:从图像生成问题,再回答问题,此过程持续迭代。
  • 使用标准 NLP 指标(BLEU、METEOR、CIDEr、ROUGE)和通过 Amazon Mechanical Turk 的人工评估来评估问题质量。
  • 人工评估关注生成的问题-答案对的可读性、正确性以及类人程度。

实验结果

研究问题

  • RQ1深度学习模型能否在无须人工提供问题的情况下,从单张图像中自主生成有意义且多样的问题?
  • RQ2模型能否生成在语义上连贯且与图像内容相关的问题-答案对?
  • RQ3在可读性与感知智能方面,自生成视觉对话的质量与流畅性有多像人类?
  • RQ4模型的推理在多大程度上反映视觉内容,而非学习到的常识性偏见?
  • RQ5自对话过程能否模拟具有逻辑推进性且减少矛盾的认知对话?

主要发现

  • 当使用最高概率生成的问题时,VQG 模型在 DAQUAR 上获得 CIDEr 得分为 0.493,在 COCO-VQA 上为 0.388,接近当前最先进图像字幕生成性能。
  • 通过 Amazon Mechanical Turk 的人工评估显示,问题可读性平均得分为 3.35(DAQUAR)和 3.39(COCO-VQA),表明生成问题具有接近人类的可读性。
  • 正确性平均得分为 2.50(DAQUAR)和 2.70(COCO-VQA),表明生成答案在语义上与图像内容相关,尽管并非完美。
  • 人工评估者认为该自对话系统“比‘有点像人’更像人,但未达到‘一半像人,一半像机器’”的程度,表明其交互具有可信度、吸引力且不引发‘恐怖谷’效应。
  • 用户常将机器人描述为有趣或讨人喜欢,仅少数人表示不适,表明系统成功避免了‘恐怖谷’效应。
  • 反馈揭示了生成对话中存在自我矛盾的情况,凸显未来在故事线建模与逻辑一致性方面仍需改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。