[论文解读] Neural Networks Trained on Natural Scenes Exhibit Gestalt Closure
本文研究了在自然图像上训练的深度神经网络是否会在没有显式监督的情况下自发表现出格式塔闭合理解——即把不完整的形状感知为完整形状。通过在内部表征上使用相似性度量,作者发现一种先进的卷积神经网络(CNN)将对齐的边缘片段视为与完整三角形在感知上等价,从而通过表征相似性表现出类似闭合的行为,支持了格式塔原则可能源自自然环境中统计学习的假设。
The Gestalt laws of perceptual organization, which describe how visual elements in an image are grouped and interpreted, have traditionally been thought of as innate despite their ecological validity. We use deep-learning methods to investigate whether natural scene statistics might be sufficient to derive the Gestalt laws. We examine the law of closure, which asserts that human visual perception tends to "close the gap" by assembling elements that can jointly be interpreted as a complete figure or object. We demonstrate that a state-of-the-art convolutional neural network, trained to classify natural images, exhibits closure on synthetic displays of edge fragments, as assessed by similarity of internal representations. This finding provides support for the hypothesis that the human perceptual system is even more elegant than the Gestaltists imagined: a single law---adaptation to the statistical structure of the environment---might suffice as fundamental.
研究动机与目标
- 测试在自然图像上训练的深度神经网络是否能在没有显式监督的情况下表现出格式塔闭合理解——即把不完整的形状感知为完整形状。
- 探究自然场景的统计结构是否足以在人工神经网络中引发类似闭合的感知,挑战格式塔原则为先天存在的观点。
- 为传统认知模型提供一种计算替代方案,后者假设感知填补功能依赖于专门的先天机制。
- 通过深层网络激活的表征相似性量化闭合程度,避免依赖行为反应模型。
提出的方法
- 使用 ImageNet 训练一个最先进的卷积神经网络(CNN)以对自然图像进行分类。
- 创建合成刺激:完整三角形、对齐的边缘片段(诱导闭合)、无序的碎片(阻止闭合),并改变其方向、大小和全局位置。
- 使用匹配图像三元组(完整、对齐、无序碎片)的特征嵌入之间的余弦相似度来测量表征相似性。
- 定义闭合度量 𝒞 为完整-对齐对与完整-无序对之间相似度的差异:𝒞 = s(f(𝑎𝑖), f(𝑐𝑖)) − s(f(𝑑𝑖), f(𝑐𝑖))。
- 在 768 个刺激三元组上计算平均闭合度量 𝒞̄,并施加约束以确保完整图像与碎片对之间具有相等的像素级重叠。
- 使用余弦相似度函数:s(x,y) = (x⋅y^T)/(|x||y|),并对零向量进行特殊处理。
实验结果
研究问题
- RQ1在自然图像上训练的深度神经网络是否能在没有显式监督或先天机制的情况下表现出格式塔闭合?
- RQ2自然场景的统计结构是否足以在人工神经网络中引发类似闭合的感知?
- RQ3深层网络中的表征相似性是否能反映人类在闭合任务中的知觉分组,如格式塔闭合?
- RQ4是否能通过内部表征量化闭合程度,而无需依赖行为反应模型?
主要发现
- 平均闭合度量 𝒞̄ 显著为正,表明网络的内部表征将对齐碎片视为与完整三角形比无序碎片更相似。
- 网络对完整三角形和对齐碎片的表征在嵌入空间中几乎完全相同,表明感知等价性。
- 闭合度量达到接近 +1 的值,表明完整与对齐刺激之间具有强烈的表征相似性,与格式塔闭合一致。
- 网络未表现出显著的负闭合值,表明未出现感知分组的反转,且该效应在不同尺寸、方向和全局位置下均保持稳健。
- 结果表明,格式塔原则如闭合可能并非先天存在,而可能源自自然环境中统计学习的产物。
- 研究结果支持一种假设:单一原则——适应环境统计——可能解释包括闭合在内的多个格式塔法则。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。