Skip to main content
QUICK REVIEW

[论文解读] Towards Learning Affine-Invariant Representations via Data-Efficient CNNs

Xenju Xu, Guanghui Wang|arXiv (Cornell University)|Aug 31, 2019
Advanced Neural Network Applications参考文献 46被引用 7
一句话总结

本文提出了一种新颖的多尺度最大池化卷积神经网络(CNN),并引入旋转不变正则化器,以在深度学习中学习仿射不变表示。通过强制二维卷积核近似圆形模式,该方法实现了卓越的数据效率和鲁棒性,在仅使用每类10张图像的情况下,Traffic Sign数据集上的测试准确率达到84.15%,相比SOTA方法高出29.80%。

ABSTRACT

In this paper we propose integrating a priori knowledge into both design and training of convolutional neural networks (CNNs) to learn object representations that are invariant to affine transformations (i.e., translation, scale, rotation). Accordingly we propose a novel multi-scale maxout CNN and train it end-to-end with a novel rotation-invariant regularizer. This regularizer aims to enforce the weights in each 2D spatial filter to approximate circular patterns. In this way, we manage to handle affine transformations in training using convolution, multi-scale maxout, and circular filters. Empirically we demonstrate that such knowledge can significantly improve the data-efficiency as well as generalization and robustness of learned models. For instance, on the Traffic Sign data set and trained with only 10 images per class, our method can achieve 84.15% that outperforms the state-of-the-art by 29.80% in terms of test accuracy.

研究动机与目标

  • 利用归纳偏置解决在CNN中学习仿射不变表示(平移、缩放、旋转)的挑战。
  • 通过将先验知识整合到网络设计与训练中,提升数据效率、泛化能力和鲁棒性。
  • 开发一种新型正则化器,强制二维卷积核近似圆形模式,以诱导旋转不变性。
  • 证明将结构与功能先验整合到深度学习中,可使模型更具可预测性、可解释性和鲁棒性。
  • 在具有与不具有仿射变换的基准数据集上评估该方法,尤其关注低数据场景下的表现。

提出的方法

  • 设计一种多尺度最大池化CNN架构,利用最大池化单元捕捉多空间尺度的特征。
  • 提出一种新型旋转不变正则化器,惩罚二维卷积核在圆形对称性上的偏离。
  • 将正则化器形式化为Tikhonov型惩罚,作用于滤波器权重,鼓励其与径向基函数或圆形模式对齐。
  • 使用带有所提正则化器的标准反向传播方法端到端训练网络,以在优化过程中强制实现旋转不变性。
  • 采用通道剪枝控制模型复杂度,并分析参数量、准确率与推理速度之间的权衡。
  • 利用多尺度卷积与最大池化增强尺度不变性,而正则化器则专门针对旋转不变性进行优化。

实验结果

研究问题

  • RQ1能否有效将关于旋转对称性的先验知识编码进CNN中,以提升对仿射变换的不变性?
  • RQ2一种鼓励圆形滤波器模式的旋转不变正则化器,如何影响模型的泛化能力与数据效率?
  • RQ3在有限数据下,该方法在多大程度上可超越最先进方法?
  • RQ4模型性能随参数量增长的规律如何?所提正则化器的计算成本是多少?
  • RQ5将结构先验(多尺度最大池化、圆形滤波器)整合是否能带来更具可解释性与鲁棒性的深度学习模型?

主要发现

  • 在仅每类10张图像的Traffic Sign数据集上,所提方法达到84.15%的测试准确率,相比SOTA高出29.80%。
  • 在affNIST上,旋转不变正则化器平均提升准确率1.52%,正则化损失值为2.94×10⁻⁷,表明滤波器模式对圆形对称性的强遵循性。
  • 在CIFAR-100上使用每类100张训练图像时,方法达到52.67%的测试准确率,较ResNet-32高出约10个百分点,显著优于TI-Pooling(31.77%)。
  • 即使参数量减少,模型仍保持强劲性能,[32,64,64,64,64]配置在约20万个参数时已接近最优准确率。
  • 训练与推理时间随参数量呈指数增长,但该方法在推理速度上仍快于Harmonics,且与STN相当,尽管参数效率更高。
  • 在CIFAR-100全量训练数据下,该方法达到78.33%的准确率,优于ResNet-32(76.7%)和GoogleNet(78.03%),显著超越其他专为不变性设计的方法(如TI-Pooling的31.77%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。