Skip to main content
QUICK REVIEW

[论文解读] Hyper-dimensional computing for a visual question-answering system that is trainable end-to-end

Guglielmo Montone, J. Kevin Ο’Regan|arXiv (Cornell University)|Nov 28, 2017
Multimodal Machine Learning Applications参考文献 6被引用 7
一句话总结

本文提出了一种端到端可训练的视觉问答系统,采用高维(HD)计算将视觉知识表示为高维向量。通过使用HD向量操作(纠缠和分组)编码图像属性与关系,并将问题表述为可微分的相似性查询,该模型在训练过的提问上实现了100%的准确率,并在新问题上实现了60–72%的准确率,展示了HD空间中有效且端到端的训练与推理能力。

ABSTRACT

In this work we propose a system for visual question answering. Our architecture is composed of two parts, the first part creates the logical knowledge base given the image. The second part evaluates questions against the knowledge base. Differently from previous work, the knowledge base is represented using hyper-dimensional computing. This choice has the advantage that all the operations in the system, namely creating the knowledge base and evaluating the questions against it, are differentiable, thereby making the system easily trainable in an end-to-end fashion.

研究动机与目标

  • 开发一种可端到端训练的视觉问答系统,以克服模块化架构中计算类型不兼容的局限性。
  • 通过使用高维计算统一感知与推理为可微分操作,解决复杂VQA模型中非可微分组件的训练挑战。
  • 证明HD计算能够实现对视觉知识的有效、可微分表示与查询评估,从而支持基于梯度的优化。
  • 评估模型在训练期间未见的新问题上的泛化性能,特别是针对罕见或未见形状的问题。

提出的方法

  • 该系统使用前馈神经网络将输入图像(28×28 RGB)映射为1000维的高维(HD)向量,以表示图像的视觉内容。
  • 每个视觉概念——颜色、形状、位置——均被编码为随机的HD向量,图像特征通过HD操作组合:使用XOR-based方法进行纠缠(绑定属性与位置),使用向量加法进行分组(聚合多个对象)。
  • 问题通过使用余弦相似度在HD向量之间计算的可微分相似性查询来表述,其中问题的真假由相似度是否超过学习到的阈值决定。
  • 网络通过复合损失函数进行端到端训练,该函数最小化五种不同问题类型中预测答案与真实答案之间的平方误差。
  • 通过计算查询模式与编码图像向量之间的相似度分数,使用网络输出的HD向量来评估所有问题。
  • 训练过程采用随机梯度下降优化网络参数,确保所有操作——编码、查询与损失计算——均为可微分。

实验结果

研究问题

  • RQ1高维计算能否为VQA系统中的视觉感知与推理提供统一且可微分的框架?
  • RQ2基于HD计算的端到端可训练VQA模型在训练期间未见的问题上泛化能力如何?
  • RQ3HD推理在涉及多个属性与空间关系的复杂关系问题上的表现如何?
  • RQ4HD向量操作能否有效编码与检索视觉知识,从而支持准确且可微分的问答?
  • RQ5当泛化超出训练数据时,模型在罕见或未见形状上的表现如何?

主要发现

  • 在保留的30%测试集上,该模型对所有五类训练过的问题类型均实现了100%的准确率,表明对已见问题模式具有完美的泛化能力。
  • 在涉及未在训练中使用的“正方形”、“三角形”和“十字”形状的新问题上测试时,模型分别实现了72%、69%和60%的准确率,表明性能虽可测量但随新颖性增加而下降。
  • 性能最差的是“十字”形状,该形状在任何训练问题中均未出现,表明泛化能力对训练分布中是否存在某类形状较为敏感。
  • 该系统成功地仅通过可微分操作编码并检索了复杂的视觉关系(例如,物体身份、空间位置、颜色、形状),从而实现了端到端的反向传播。
  • HD计算的使用使得所有组件——知识库构建与问题评估——均为可微分,从而通过梯度下降实现了高效且稳定的训练。
  • 结果证实,HD计算为视觉问答中感知与推理的整合提供了一个可行且可微分的基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。