Skip to main content
QUICK REVIEW

[论文解读] Statistically Motivated Second Order Pooling

Kaicheng Yu, Mathieu Salzmann|arXiv (Cornell University)|Jan 23, 2018
Advanced Image and Video Retrieval Techniques参考文献 38被引用 7
一句话总结

本文提出了一种基于统计动机的参数化压缩方法,用于深度网络中的二阶池化,通过利用高斯分布的特征表示以及威沙特分布的协方差矩阵,并结合可学习变换,实现了高达90%的参数减少,同时在多个基准测试中达到最先进(SOTA)的准确率,优于压缩和未压缩的二阶模型。

ABSTRACT

Second-order pooling, a.k.a.~bilinear pooling, has proven effective for deep learning based visual recognition. However, the resulting second-order networks yield a final representation that is orders of magnitude larger than that of standard, first-order ones, making them memory-intensive and cumbersome to deploy. Here, we introduce a general, parametric compression strategy that can produce more compact representations than existing compression techniques, yet outperform both compressed and uncompressed second-order models. Our approach is motivated by a statistical analysis of the network's activations, relying on operations that lead to a Gaussian-distributed final representation, as inherently used by first-order deep networks. As evidenced by our experiments, this lets us outperform the state-of-the-art first-order and second-order models on several benchmark recognition datasets.

研究动机与目标

  • 为解决由于高维表示导致的深度网络中二阶池化带来的内存占用和过拟合问题。
  • 开发一种通用的参数化压缩策略,相较于现有方法,保持或提升表示能力。
  • 使最终特征分布与成功的一阶网络中固有的高斯假设对齐,从而提升泛化能力。
  • 通过显著减少模型大小而不牺牲性能,实现二阶网络的有效部署。

提出的方法

  • 提出一种参数化向量化(PV)层,通过可学习参数压缩协方差矩阵,降低维度的同时保留二阶信息。
  • 在PV输出上应用平方根归一化,将χ²分布的特征向高斯分布转化,其动机来自中心极限定理。
  • 在归一化后引入可学习的缩放和偏移(γ, β),进一步使最终表示与高斯分布对齐。
  • 通过统计分析证明最终表示服从高斯分布,与一阶网络一致,从而提升泛化能力。
  • 通过端到端训练与标准反向传播,将该方法应用于标准CNN(VGG-D, ResNet-50)。
  • 采用威沙特分布对协方差矩阵进行建模,以证明所提变换的统计基础。

实验结果

研究问题

  • RQ1基于统计基础的二阶池化压缩策略是否能在减少模型大小的同时提升性能?
  • RQ2将最终特征分布与高斯分布对齐是否能提升二阶深度网络的准确率?
  • RQ3参数化压缩方法是否能在二阶网络中超越非参数化或任务特定的压缩基线?
  • RQ4该方法在不同压缩水平下,特别是在极端压缩(如参数减少至10%)时的鲁棒性如何?
  • RQ5使用可学习的归一化层(γ, β)是否能显著提升性能,相比固定变换?

主要发现

  • 所提出的SMSO方法在DTD、MINC-2500和MIT-Indoor数据集上,优于最先进的一阶模型(如VGG-D、ResNet-50)以及所有二阶基线模型。
  • 仅使用64维(参数减少90%)时,SMSO在MINC-2500数据集上达到78.00%的准确率,与性能最佳的压缩基线(CBP-TS)相当,但参数量减少90%。
  • 在ResNet-50上,SMSO始终优于原始网络和所有二阶基线模型,证明其在增强深度架构方面的有效性。
  • 消融实验表明,通过可学习的γ, β实现的高斯分布特征可获得最高准确率(78.00%),显著优于非高斯分布。
  • 该方法在不同PV维度下均表现稳健,在p=64时仍保持高准确率,并在所有测试数据集上表现出稳定性能。
  • 平方根、立方根和对数等变换均优于无变换,但结合可学习缩放和偏移的组合效果最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。