Skip to main content
QUICK REVIEW

[论文解读] Disentangling neural mechanisms for perceptual grouping

Junkyung Kim, Drew Linsley|arXiv (Cornell University)|Jun 4, 2019
Face Recognition and Perception参考文献 70被引用 10
一句话总结

本文通过使用一种生物启发的循环神经网络(TD+H-CNN)和两个合成视觉任务——Pathfinder(基于格式塔的)与杂乱ABC(基于物体的)挑战——研究了自下而上、横向以及自上而下的神经连接在知觉分组中的不同作用。结果表明,横向连接在格式塔线索下支持渐进式分组,而自上而下的连接则在基于物体的线索下优化粗略预测,证明了这三种连接类型在实现稳健知觉分组中均不可或缺。

ABSTRACT

Forming perceptual groups and individuating objects in visual scenes is an essential step towards visual intelligence. This ability is thought to arise in the brain from computations implemented by bottom-up, horizontal, and top-down connections between neurons. However, the relative contributions of these connections to perceptual grouping are poorly understood. We address this question by systematically evaluating neural network architectures featuring combinations bottom-up, horizontal, and top-down connections on two synthetic visual tasks, which stress low-level "Gestalt" vs. high-level object cues for perceptual grouping. We show that increasing the difficulty of either task strains learning for networks that rely solely on bottom-up connections. Horizontal connections resolve straining on tasks with Gestalt cues by supporting incremental grouping, whereas top-down connections rescue learning on tasks with high-level object cues by modifying coarse predictions about the position of the target object. Our findings dissociate the computational roles of bottom-up, horizontal and top-down connectivity, and demonstrate how a model featuring all of these interactions can more flexibly learn to form perceptual groups.

研究动机与目标

  • 理解自下而上、横向和自上而下神经连接在视觉场景中对知觉分组的相对贡献。
  • 探究当仅依赖自下而上处理在视觉杂乱条件下失效时,循环反馈机制如何支持知觉分组。
  • 开发并评估一种生物合理性的深度学习架构,以分离不同神经连接类型的功功能。
  • 提出一种新型合成基准——杂乱ABC(cABC)挑战,以探测超越低水平格式塔原则的高层级基于物体的分组。
  • 通过在可控且可测量的条件下测试关于反馈回路的假设,弥合计算神经科学与深度学习之间的鸿沟。

提出的方法

  • 设计了一种具有显式自下而上、横向和自上而下连接的深度循环神经网络(TD+H-CNN),以模拟分层和循环的视觉处理。
  • 构建了网络的损伤变体:BU-CNN(仅自下而上)、H-CNN(自下而上 + 横向)、TD-CNN(自下而上 + 自上而下)以及TD+H-CNN(所有连接),以隔离各部分的功能贡献。
  • 设计了两个合成视觉任务:Pathfinder挑战(通过相似性和连续性实现基于格式塔的分组)和杂乱ABC(cABC)挑战(利用语义和结构先验实现基于物体的分组)。
  • 在两个挑战中系统性地提高任务难度,以施加学习压力并评估网络在退化条件下的鲁棒性。
  • 通过人类心理物理学实验,采用可变的反应时间窗口,验证任务的认知合理性,并比较人类与模型的表现。
  • 在两个任务上训练并评估网络,分析活动的时间轨迹和分类准确率,以推断每种连接类型的功功能。

实验结果

研究问题

  • RQ1当存在低水平的格式塔线索时,横向连接如何促进知觉分组?
  • RQ2在需要高层级物体知识时,自上而下反馈的作用是什么?
  • RQ3仅依赖自下而上连接的模型能否泛化到具有背景杂乱的复杂视觉场景?
  • RQ4自下而上、横向和自上而下连接如何相互作用,以支持在不同视觉挑战中灵活的知觉分组?
  • RQ5cABC和Pathfinder任务在多大程度上分别捕捉了不同的认知过程——即格式塔分组与基于物体的分组?

主要发现

  • 在Pathfinder和cABC挑战中,仅依赖自下而上连接的网络在任务难度增加时均无法学习。
  • 横向连接通过支持局部特征组合的传播,实现了渐进式分组,在高难度下显著提升了Pathfinder任务的表现。
  • 自上而下连接通过利用高层语义先验,对物体位置的粗略预测进行优化,从而挽救了cABC任务的学习。
  • 包含所有三种连接类型的完整TD+H-CNN模型在两个任务中均实现了最稳健且灵活的知觉分组。
  • 人类在任务中的表现遵循相似模式,简单任务反应更快,Pathfinder任务准确率高于cABC任务,表明人类认知与模型的功能分离具有一致性。
  • 活动时间轨迹分析证实,横向连接在分组过程中维持了动态、渐进的更新,而自上而下信号则通过反馈回路调制了早期的粗略表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。