Skip to main content
QUICK REVIEW

[论文解读] Visual analogy: Deep learning versus compositional models

Nicholas Ichien, Qing Liu|arXiv (Cornell University)|May 14, 2021
Multimodal Machine Learning Applications参考文献 25被引用 7
一句话总结

本文研究了人工智能中的视觉类比求解是否依赖端到端深度学习,还是基于结构化部件表征的组合模型。研究将人类在图像类比任务上的表现与深度学习模型(孪生网络、关系网络)以及基于部件关系相似性的组合模型进行比较。结果显示,组合模型而非深度学习模型更接近人类的表现模式,表明类比推理可能依赖于结构化、组合化的表征,而非纯粹的数据驱动学习。

ABSTRACT

Is analogical reasoning a task that must be learned to solve from scratch by applying deep learning models to massive numbers of reasoning problems? Or are analogies solved by computing similarities between structured representations of analogs? We address this question by comparing human performance on visual analogies created using images of familiar three-dimensional objects (cars and their subregions) with the performance of alternative computational models. Human reasoners achieved above-chance accuracy for all problem types, but made more errors in several conditions (e.g., when relevant subregions were occluded). We compared human performance to that of two recent deep learning models (Siamese Network and Relation Network) directly trained to solve these analogy problems, as well as to that of a compositional model that assesses relational similarity between part-based representations. The compositional model based on part representations, but not the deep learning models, generated qualitative performance similar to that of human reasoners.

研究动机与目标

  • 确定人工智能中的视觉类比推理是否需要大规模端到端学习,还是可通过结构化、组合化表征实现。
  • 评估端到端训练的深度学习模型(孪生网络、关系网络)在视觉类比任务上的表现是否与人类推理相当。
  • 检验基于部件表征的组合模型是否能复制人类在视觉类比求解中的表现模式。
  • 探究结构化部件之间的关系相似性是否比深度网络学习到的特征相似性更适合作为类比推理的基础。

提出的方法

  • 人类参与者通过3D物体图像(如汽车及其子区域)解决视觉类比问题,实验控制了遮挡和视角变化等变量。
  • 使用相同类比数据集,对两种深度学习模型——孪生网络和关系网络——进行端到端训练,以预测正确类比。
  • 开发了一种组合模型,通过将物体结构化分解为子区域,计算图像部件表征之间的关系相似性。
  • 在多种条件下评估性能,包括遮挡和视角变化,以检验模型的鲁棒性与人类相似性。
  • 定量与定性比较模型表现与人类表现,重点关注不同条件下的错误模式与准确率。
  • 组合模型采用显式的部件级表征与关系匹配机制,避免对原始图像像素进行端到端训练。

实验结果

研究问题

  • RQ1在大规模视觉类比数据集上训练的深度学习模型能否复制人类的表现模式?
  • RQ2基于部件表征的组合模型是否比端到端深度学习模型更贴近人类在视觉类比中的推理方式?
  • RQ3遮挡与视角变化如何影响人类与模型在视觉类比任务中的表现?
  • RQ4结构化部件之间的关系相似性是否比深度网络学习到的特征相似性更适合作为类比推理的基础?

主要发现

  • 人类参与者在所有问题类型上均达到显著高于随机水平的准确率,当相关子区域被遮挡时错误率上升。
  • 孪生网络与关系网络模型表现出较差的泛化能力,且未能复制人类在遮挡条件下的错误模式。
  • 基于部件表征的组合模型在错误分布等表现模式上与人类推理者具有定性相似性,尤其在不同条件下的错误分布方面。
  • 该组合模型在捕捉人类类比推理方面优于深度学习模型,尤其在部分遮挡等挑战性条件下表现更优。
  • 结果表明,视觉类比推理可能依赖于结构化、组合化的表征,而非纯粹的端到端学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。