[论文解读] Convolutional Neural Networks Deceived by Visual Illusions
该论文表明,为低层次视觉任务(如图像去噪、去模糊和颜色恒常性)训练的卷积神经网络(CNNs)会复现人类对视觉错觉的感知反应,表明错觉是其架构和训练过程的副产品。关键发现是,即使简单的CNN也能复现诸如颜色同化和对比效应等错觉,且其表现因网络架构和空间频率而异。
Visual illusions teach us that what we see is not always what it is represented in the physical world. Its special nature make them a fascinating tool to test and validate any new vision model proposed. In general, current vision models are based on the concatenation of linear convolutions and non-linear operations. In this paper we get inspiration from the similarity of this structure with the operations present in Convolutional Neural Networks (CNNs). This motivated us to study if CNNs trained for low-level visual tasks are deceived by visual illusions. In particular, we show that CNNs trained for image denoising, image deblurring, and computational color constancy are able to replicate the human response to visual illusions, and that the extent of this replication varies with respect to variation in architecture and spatial pattern size. We believe that this CNNs behaviour appears as a by-product of the training for the low level vision tasks of denoising, color constancy or deblurring. Our work opens a new bridge between human perception and CNNs: in order to obtain CNNs that better replicate human behaviour, we may need to start aiming for them to better replicate visual illusions.
研究动机与目标
- 探究为低层次视觉任务训练的CNN是否以与人类相同的方式被视觉错觉所欺骗。
- 探讨架构差异(例如空洞卷积、残差连接)如何影响CNN复现视觉错觉的能力。
- 确定错觉复现是否源于底层任务(例如去噪、颜色恒常性)而非架构设计。
- 通过将视觉错觉用作CNN行为的验证基准,建立人类感知与深度学习之间的新桥梁。
- 探究错觉复现是否可用于指导更类人视觉模型的设计,并提升对对抗攻击的鲁棒性。
提出的方法
- 在自然图像数据集上为单层和深层CNN训练图像去噪、去模糊及颜色恒常性任务。
- 将网络输出与人类感知数据对比,评估五种经典视觉错觉的表现:Dungeon(同化)、Lum(对比)等。
- 应用架构修改,包括空洞卷积、池化层和残差连接,以评估其对错觉复现的影响。
- 采用标准化评估流程:将模型输出与人类对错觉刺激的感知排序进行比较。
- 测试错觉的灰度和彩色版本,以评估跨模态泛化能力。
- 对最先进的去噪CNN(Zhang2017)进行评估,以与简单架构进行对比。
实验结果
研究问题
- RQ1为低层次视觉任务训练的CNN是否复现人类对视觉错觉的反应?
- RQ2空洞卷积和残差连接等架构组件如何影响视觉错觉的复现?
- RQ3错觉复现是否依赖于CNN所训练的具体任务(例如去噪与颜色恒常性)?
- RQ4经过颜色训练的CNN能否在灰度图像中复现错觉?这对亮度感知的神经基础有何启示?
- RQ5错觉复现能否作为提升深度学习视觉模型类人程度的基准?
主要发现
- 即使是一个仅含8个卷积核的简单单层CNN,也能复现人类对颜色同化和对比效应等视觉错觉的反应。
- 架构调整如空洞卷积和残差连接会改变错觉复现的范围,某些配置可能抑制或保留特定效应。
- 残差连接可在某些错觉(如Dungeon和Lum)中消除灰度图像中的错觉复现,但在彩色图像中则不会,表明其具有模态特异性。
- 最先进的去噪CNN(Zhang2017)在一定程度上复现了错觉效应,表明即使先进模型也未完全免疫于感知失真。
- 经过颜色训练的CNN能在灰度图像中复现错觉,暗示视觉系统中颜色与亮度感知之间可能存在潜在关联。
- 错觉复现并非普遍现象——某些错觉始终被复现,而另一些则否,具体取决于网络结构和输入图案尺寸。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。