Skip to main content
QUICK REVIEW

[论文解读] High-contrast "gaudy" images improve the training of deep neural network models of visual cortex

Benjamin R. Cowley, Jonathan W. Pillow|arXiv (Cornell University)|Jun 13, 2020
Image Processing Techniques and Applications参考文献 59被引用 4
一句话总结

本文提出‘艳丽图像’——即高对比度、二值化的自然图像——作为一种数据高效训练深度神经网络(DNN)视觉皮层神经元读出模型的策略。通过在图像均值处进行二值化阈值处理,艳丽图像最大化像素方差,从而显著突出边缘和高对比度特征,大幅减少达到高预测准确率所需的训练图像数量,在某些情况下甚至优于主动学习方法。

ABSTRACT

A key challenge in understanding the sensory transformations of the visual system is to obtain a highly predictive model of responses from visual cortical neurons. Deep neural networks (DNNs) provide a promising candidate for such a model. However, DNNs require orders of magnitude more training data than neuroscientists can collect from real neurons because experimental recording time is severely limited. This motivates us to find images that train highly-predictive DNNs with as little training data as possible. We propose gaudy images---high-contrast binarized versions of natural images---to efficiently train DNNs. In extensive simulation experiments, we find that training DNNs with gaudy images substantially reduces the number of training images needed to accurately predict the simulated responses of visual cortical neurons. We also find that gaudy images, chosen before training, outperform images chosen during training by active learning algorithms. Thus, gaudy images overemphasize features of natural images, especially edges, that are the most important for efficiently training DNNs. We believe gaudy images will aid in the modeling of visual cortical neurons, potentially opening new scientific questions about visual processing, as well as aid general practitioners that seek ways to improve the training of DNNs.

研究动机与目标

  • 减少训练准确的视觉皮层反应深度神经网络(DNN)模型所需的实验神经记录数据量。
  • 识别在数据稀缺条件下能最大化信息增益的图像刺激,尤其在DNN训练中。
  • 检验预先选定的高对比度图像是否能在训练DNN读出模型方面超越自适应的主动学习刺激。
  • 评估艳丽图像在视觉任务中数据增强和迁移学习方面的实用性。

提出的方法

  • 通过将自然图像的每个颜色通道二值化来生成艳丽图像:若像素强度低于图像均值,则设为0;若高于均值,则设为255。
  • 使用艳丽图像作为输入训练DNN读出模型,目标是预测模拟视觉皮层神经元的响应。
  • 在多种DNN架构和预训练模型(如VGG19、ResNet-50)上,对比艳丽图像与主动学习方法(如基于池的、核心集、集成方法)选择的图像在性能上的差异。
  • 利用反向传播分析梯度,识别哪些图像特征(如边缘)在读出网络中引发最具有信息量的更新。
  • 通过比较正常图像与艳丽图像在ImageNet预训练DNN上的top-5分类预测结果,评估其在数据增强方面的潜力。
  • 通过归一化艳丽图像集与正常图像集的预测类别概率,控制图像数据集中的类别不平衡问题。

实验结果

研究问题

  • RQ1能否在训练前生成的艳丽图像,其性能优于训练过程中主动选择的图像,用于训练视觉皮层响应的DNN读出模型?
  • RQ2艳丽图像在多大程度上减少了达到DNN模型高预测准确率所需的训练图像数量?
  • RQ3哪些图像特征(如边缘、纹理)对训练DNN读出网络最具信息量?艳丽图像是否过度强调了这些特征?
  • RQ4鉴于艳丽图像与自然图像具有结构相似性,它们是否适用于物体识别任务中的数据增强?
  • RQ5预训练DNN对艳丽图像的分类输出是否与对自然图像的输出保持一致?

主要发现

  • 艳丽图像显著减少了训练视觉皮层神经元DNN读出模型以达到高预测准确率所需的训练图像数量,其性能远超标准自然图像。
  • 艳丽图像在预测模拟V4神经元响应方面,性能优于或至少不逊于主动学习算法,尽管其图像选择发生在训练之前。
  • 训练性能提升的主要原因是艳丽图像对高对比度边缘的过度强调,这些特征在反向传播过程中产生大而具有信息量的梯度。
  • 在多个预训练DNN中,显著比例的艳丽图像(p < 0.001)与其自然对应图像在top-5类别预测中至少有一个匹配,表明其在数据增强方面具有实用性。
  • 尽管在分类相似性方面表现优异,艳丽图像在预测类别概率上表现出偏差,其概率更集中于特定类别(如400–1000),提示可能存在类别特异性误分类风险。
  • 结果表明,艳丽图像在数据有限时特别有效,可作为神经科学和视觉应用中主动学习的低成本强大替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。