Skip to main content
QUICK REVIEW

[论文解读] Solving Raven's Progressive Matrices with Neural Networks

Tao Zhuo, Mohan Kankanhalli|arXiv (Cornell University)|Feb 5, 2020
Neural Networks and Applications参考文献 30被引用 17
一句话总结

本文提出一种基于预训练ResNet-50的监督深度学习方法,以及一种新颖的无监督方法——带伪目标的多标签分类(MCPT),用于解决瑞文推理矩阵(RPM)。监督方法在准确率上达到86.26%,超过人类水平表现(84.41%);而MCPT在无标注数据条件下将随机猜测的准确率翻倍至28.50%,展示了人工智能在迈向类人推理方面的重要进展。

ABSTRACT

Raven's Progressive Matrices (RPM) have been widely used for Intelligence Quotient (IQ) test of humans. In this paper, we aim to solve RPM with neural networks in both supervised and unsupervised manners. First, we investigate strategies to reduce over-fitting in supervised learning. We suggest the use of a neural network with deep layers and pre-training on large-scale datasets to improve model generalization. Experiments on the RAVEN dataset show that the overall accuracy of our supervised approach surpasses human-level performance. Second, as an intelligent agent requires to automatically learn new skills to solve new problems, we propose the first unsupervised method, Multilabel Classification with Pseudo Target (MCPT), for RPM problems. Based on the design of the pseudo target, MCPT converts the unsupervised learning problem to a supervised task. Experiments show that MCPT doubles the testing accuracy of random guessing e.g. 28.50% vs. 12.5%. Finally, we discuss the problem of solving RPM with unsupervised and explainable strategies in the future.

研究动机与目标

  • 通过使用深度神经网络和ImageNet预训练,提升监督RPM求解中的泛化能力并减少过拟合。
  • 开发一种无监督学习方法,通过在无标注数据下学习抽象规则,模拟类人推理过程。
  • 弥合机器性能与人类在抽象视觉推理任务中类人推理能力之间的差距。
  • 探索无监督、可解释表示学习在人工智能视觉推理中的可行性。

提出的方法

  • 使用带有ImageNet预训练的深度残差网络(ResNet-50),以提升监督RPM分类中的泛化能力并减少过拟合。
  • 通过伪目标向量的多分类方法,将无监督RPM求解转化为监督多标签学习任务。
  • 设计一个10维的双热伪目标向量,其中前两个元素对应正确规则匹配的行(第一行和第二行)以及正确答案所在的行。
  • 对于每个候选答案,模型生成完整的矩阵行,模型通过伪目标学习将正确答案行分类为与前两行相同的标签。
  • 采用对比学习策略,通过鼓励模型在共享相同逻辑规则的行之间学习一致的表示。
  • 使用RAVEN数据集进行评估,性能通过在多种图形配置下的测试集Top-1准确率进行衡量。

实验结果

研究问题

  • RQ1使用ImageNet预训练和深度架构的深度神经网络是否能在减少过拟合的前提下,超越现有方法在RPM求解中的表现?
  • RQ2无监督方法是否能在不使用任何标注数据的情况下实现有意义的性能,接近类人推理?
  • RQ3无监督方法在抽象视觉推理任务中的表现与随机猜测和人类水平表现相比如何?
  • RQ4无监督模型在多大程度上能学习到可解释的、基于规则的视觉推理表示?

主要发现

  • 采用ResNet-50和ImageNet预训练的监督方法在RAVEN数据集上达到86.26%的准确率,超过人类水平表现的84.41%。
  • 所提出的无监督方法MCPT在测试集上达到28.50%的准确率,是随机猜测准确率12.5%的两倍。
  • 在L-R和O-IC等特定图形配置下,监督方法的表现超过人类10个百分点以上。
  • 泛化能力仍有限:在简单配置上训练的模型在复杂配置上表现不佳,而人类能更有效地进行泛化。
  • 无监督MCPT方法在Center和O-IC配置上表现尤为突出,准确率超过33%。
  • 尽管准确率较高,当前模型缺乏可解释性——与人类不同,它们无法阐明其预测背后的逻辑规则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。