Skip to main content
QUICK REVIEW

[论文解读] End-to-end topographic networks as models of cortical map formation and human visual behaviour: moving beyond convolutions

Zejin Lu, Adrien Doerig|arXiv (Cornell University)|Aug 18, 2023
Visual perception and processing mechanisms被引用 4
一句话总结

本文提出了一种新型深度学习架构——全拓扑神经网络(All-Topographic Neural Networks, All-TNNs),通过用空间结构化、拓扑组织化的层替代标准卷积层,模拟灵长类视觉皮层的拓扑组织特性。All-TNNs 在视觉输入上端到端训练,早期层能自组织形成平滑的方位偏好图和皮层放大效应,后期层则形成类别选择性区域,且在预测人类在物体识别中的空间偏倚方面显著优于卷积神经网络。

ABSTRACT

Computational models are an essential tool for understanding the origin and functions of the topographic organisation of the primate visual system. Yet, vision is most commonly modelled by convolutional neural networks that ignore topography by learning identical features across space. Here, we overcome this limitation by developing All-Topographic Neural Networks (All-TNNs). Trained on visual input, several features of primate topography emerge in All-TNNs: smooth orientation maps and cortical magnification in their first layer, and category-selective areas in their final layer. In addition, we introduce a novel dataset of human spatial biases in object recognition, which enables us to directly link models to behaviour. We demonstrate that All-TNNs significantly better align with human behaviour than previous state-of-the-art convolutional models due to their topographic nature. All-TNNs thereby mark an important step forward in understanding the spatial organisation of the visual brain and how it mediates visual behaviour.

研究动机与目标

  • 开发一种能够捕捉灵长类视觉皮层空间拓扑特性的深度学习模型,以弥补标准卷积神经网络在该方面的不足。
  • 通过在神经网络架构中引入空间组织,弥合计算模型在皮层图形成与人类视觉行为之间的差距。
  • 创建一个全新的、用于测量人类在物体识别中空间偏倚的人类行为数据集,以直接评估模型与人类行为的对齐程度。
  • 证明在神经网络中引入拓扑组织可显著提升对人类视觉行为的预测能力,优于标准卷积模型。

提出的方法

  • 设计全拓扑神经网络(All-TNNs),用具有拓扑结构、空间不变的特征图替代标准卷积层,以反映皮层图原理。
  • 在自然图像数据集上实现All-TNNs的端到端训练,使其在无监督条件下自组织形成拓扑特征。
  • 整合一项新型人类行为数据集,用于测量物体识别中的空间偏倚,以评估模型性能与人类数据的匹配程度。
  • 训练All-TNNs在第一层学习平滑的方位偏好图和皮层放大效应,在深层学习类别选择性响应。
  • 采用反映视觉皮层中视网膜投射与拓扑映射已知原理的空间结构化权重初始化与连接模式。
  • 将All-TNNs与当前最先进的卷积神经网络(CNNs)在拓扑特征的生成与人类行为预测方面进行直接比较。

实验结果

研究问题

  • RQ1具备拓扑组织的深度神经网络架构能否自组织形成灵长类视觉拓扑的关键特征,如方位偏好图与皮层放大?
  • RQ2用拓扑层替代卷积层是否能提升深度学习模型与人类视觉行为的对齐程度?
  • RQ3与标准CNN相比,All-TNNs在预测人类在物体识别中的空间偏倚方面表现如何?
  • RQ4神经网络中的拓扑组织能否促使类似人类视觉皮层外侧膝状体皮层中功能区域的类别选择性区域出现?
  • RQ5在视觉模型评估中,引入人类行为数据集在多大程度上提升了皮层图模型的评估质量?

主要发现

  • All-TNNs 在其第一层成功自组织形成平滑的方位偏好图与皮层放大效应,与灵长类视觉皮层的关键特征高度一致。
  • All-TNNs 在深层发展出类别选择性响应,表明其可能涌现出类似于人类外侧膝状体皮层的功能视觉区域。
  • 与当前最先进的卷积神经网络相比,All-TNNs 在预测人类在物体识别中的空间偏倚方面表现出显著更优的对齐性。
  • 拓扑架构使模型能够更准确地预测人类行为数据,证明了空间组织的功能相关性。
  • 新型人类行为数据集揭示了物体识别中系统性的空间偏倚,而这些偏倚更易被拓扑模型捕捉。
  • 结果表明,拓扑组织不仅在生物学上合理,而且在建模人类视觉感知方面具有显著的功能优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。