Skip to main content
QUICK REVIEW

[论文解读] Multi Layer Neural Networks as Replacement for Pooling Operations

Wolfgang Fuhl, Enkelejda Kasneci|arXiv (Cornell University)|Jun 12, 2020
Computational Physics and Python Applications参考文献 64被引用 6
一句话总结

本文提出在卷积神经网络中使用单个感知器或浅层多层神经网络作为可学习的池化操作,替代传统的最大池化或平均池化。通过将特征图重新组织为感知器的输入,该方法在参数增加极少的情况下实现了具有竞争力的准确率,并支持端到端训练,包括语义分割任务中的上采样操作。

ABSTRACT

Pooling operations, which can be calculated at low cost and serve as a linear or nonlinear transfer function for data reduction, are found in almost every modern neural network. Countless modern approaches have already tackled replacing the common maximum value selection and mean value operations, not to mention providing a function that allows different functions to be selected through changing parameters. Additional neural networks are used to estimate the parameters of these pooling functions.Consequently, pooling layers may require supplementary parameters to increase the complexity of the whole model. In this work, we show that one perceptron can already be used effectively as a pooling operation without increasing the complexity of the model. This kind of pooling allows for the integration of multi-layer neural networks directly into a model as a pooling operation by restructuring the data and, as a result, learnin complex pooling operations. We compare our approach to tensor convolution with strides as a pooling operation and show that our approach is both effective and reduces complexity. The restructuring of the data in combination with multiple perceptrons allows for our approach to be used for upscaling, which can then be utilized for transposed convolutions in semantic segmentation.

研究动机与目标

  • 解决固定池化操作(如最大池化、平均池化)缺乏对输入数据和任务特定模式适应能力的局限性。
  • 通过用可学习的参数化操作替代传统池化,降低模型复杂度,同时提升性能。
  • 探究简单的神经网络是否可作为高效、低复杂度的池化层替代方案,且不增加计算开销。
  • 通过将池化操作直接集成到网络架构中,无需辅助分支,实现池化操作的端到端训练。
  • 将该方法扩展至上采样操作,利用相同的基于神经网络的池化机制,应用于转置卷积和语义分割任务。

提出的方法

  • 将特征图激活值重新组织为1D向量,输入单个感知器或浅层多层网络,替代标准池化层。
  • 使用带有可学习权重和偏置的感知器作为可微分的、参数化的池化函数,支持端到端训练。
  • 构建多层感知器(如4-1或4-16-1)以从特征图中学习复杂非线性池化函数。
  • 通过数据重构,将相同的神经网络架构同时应用于下采样(池化)和上采样(转置卷积)操作。
  • 使用反向传播对整个模型进行端到端训练,池化操作的参数与网络其他权重共同更新。
  • 以步长大卷积作为基线进行比较,证明所提方法在参数更少的情况下实现了相似或更优的性能。

实验结果

研究问题

  • RQ1单个感知器是否能在不增加模型复杂度的前提下,有效替代CNN中传统的最大池化或平均池化操作?
  • RQ2基于可学习感知器的池化层在图像分类任务中的性能,与固定池化和步长大卷积池化相比如何?
  • RQ3多层感知器是否可用作池化操作,以学习复杂非线性特征压缩模式?
  • RQ4相同的基于神经网络的池化机制是否可有效应用于语义分割架构中的上采样操作?
  • RQ5将可学习池化层集成到主网络路径中,是否能在保持计算效率的同时提升模型准确率?

主要发现

  • 在CIFAR10数据集上,使用图2中模型c)的三组实验中,基于感知器的池化操作在三组中表现优于最大池化和平均池化。
  • 在CIFAR10上,NN-4-1(隐藏层4个感知器,输出1个)在所有测试池化方法中表现最佳,性能与步长大卷积池化相当。
  • 在具有挑战性的VOC2012语义分割数据集上,用基于感知器的池化和上采样操作替代标准池化和上采样层,显著提升了分割准确率。
  • 该方法在性能上与步长大卷积相当,但引入的参数显著更少,且保持了O(n)的计算复杂度。
  • 该方法在训练中表现稳定,当出现不稳定时,通过降低初始学习率可有效优化。
  • 用于池化的同一神经网络架构,通过数据重构可被重新用于上采样,从而实现有效的转置卷积学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。