Skip to main content
QUICK REVIEW

[论文解读] Efficient Convolutional Auto-Encoding via Random Convexification and Frequency-Domain Minimization

Meshia Cédric Oveneke, Mitchel Alioscha‐Perez|arXiv (Cornell University)|Nov 28, 2016
Geophysical Methods and Applications参考文献 15被引用 4
一句话总结

本文提出了一种资源高效、无监督的深度卷积神经网络训练策略,通过随机凸化和频域坐标下降求解重构收缩自编码(RCAE)目标。通过固定非线性编码参数,并在频域中最小化由此产生的凸、大规模最小二乘问题,该方法实现了线性时间复杂度,仅需一个可调参数即可实现快速收敛,并具备完全并行化的潜力——在仅使用400张训练图像的情况下,其性能可线性扩展至图像尺寸、滤波器数量和滤波器大小。

ABSTRACT

The omnipresence of deep learning architectures such as deep convolutional neural networks (CNN)s is fueled by the synergistic combination of ever-increasing labeled datasets and specialized hardware. Despite the indisputable success, the reliance on huge amounts of labeled data and specialized hardware can be a limiting factor when approaching new applications. To help alleviating these limitations, we propose an efficient learning strategy for layer-wise unsupervised training of deep CNNs on conventional hardware in acceptable time. Our proposed strategy consists of randomly convexifying the reconstruction contractive auto-encoding (RCAE) learning objective and solving the resulting large-scale convex minimization problem in the frequency domain via coordinate descent (CD). The main advantages of our proposed learning strategy are: (1) single tunable optimization parameter; (2) fast and guaranteed convergence; (3) possibilities for full parallelization. Numerical experiments show that our proposed learning strategy scales (in the worst case) linearly with image size, number of filters and filter size.

研究动机与目标

  • 为解决深度CNN在资源受限环境下的局限性,减少对标注数据和专用硬件的依赖。
  • 克服随机梯度下降(SGD)在非凸RCAE优化中计算成本高且需手动调参的弊端。
  • 实现在常规CPU上高效、贪婪的逐层无监督预训练深度CNN。
  • 实现快速、保证收敛的优化,且超参数调优极少。
  • 利用并行化机会,在标准硬件上实现可扩展的大规模自编码。

提出的方法

  • 通过固定非线性编码滤波器和偏置,对非凸RCAE目标进行随机凸化,将问题转化为凸最小化任务。
  • 应用离散傅里叶变换(DFT)将RCAE目标映射到频域,通过FFT实现高效计算。
  • 使用坐标下降(CD)最小化频域变换后的目标,逐个更新解码滤波器。
  • 将复值解码滤波器初始化为零,并对所有滤波器执行一次CD循环,以确保收敛。
  • 利用频域问题的结构特性,实现在滤波器坐标上的完全并行化。
  • 采用双曲正切激活函数,并对输入图像进行白化处理以实现稳定训练。

实验结果

研究问题

  • RQ1RCAE目标的随机凸化是否能转化为适合高效最小化的可处理凸优化问题?
  • RQ2通过DFT进行频域变换是否能实现RCAE问题的可扩展且可并行化的求解?
  • RQ3在频域问题上使用坐标下降是否能仅通过一个可调参数实现快速、保证收敛?
  • RQ4在该方法下,计算复杂度如何随图像尺寸、滤波器数量和滤波器大小变化?
  • RQ5该方法是否能在极少标注数据和常规硬件上实现良好的重建性能?

主要发现

  • 所提方法在图像尺寸、滤波器数量和滤波器大小方面均表现出最坏情况下的线性时间复杂度,表明其具有最优可扩展性。
  • 在正则化参数λ = 16.5时,重建误差达到全局最小值,表明对超参数具有良好的敏感性。
  • 在约400张训练图像后,学习到的解码滤波器即实现收敛,表明在数据有限条件下学习速度极快。
  • 仅使用400张训练图像,对未见测试图像的重建结果在视觉上合理,验证了模型的泛化能力。
  • 收敛速度(以连续滤波器更新间平均平方差衡量)迅速稳定,证实了快速收敛。
  • 频域CD方法固有的并行性使其在优化实现下具备显著的性能加速潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。