Skip to main content
QUICK REVIEW

[论文解读] Spatial Frequency Loss for Learning Convolutional Autoencoders

Naoyuki Ichimura|arXiv (Cornell University)|Jun 6, 2018
Image and Signal Denoising Methods参考文献 14被引用 10
一句话总结

本文提出了一种空间频率损失(SFL),用于训练卷积自编码器(CAEs),以减少重建图像中的模糊现象。通过应用拉普拉斯滤波器组提取高频特征,并最小化这些子带特征的均方误差,该方法比标准像素损失更有效地保留边缘和纹理,从而实现更清晰的重建,且高频损失分量在定量上显著降低。

ABSTRACT

This paper presents a learning method for convolutional autoencoders (CAEs) for extracting features from images. CAEs can be obtained by utilizing convolutional neural networks to learn an approximation to the identity function in an unsupervised manner. The loss function based on the pixel loss (PL) that is the mean squared error between the pixel values of original and reconstructed images is the common choice for learning. However, using the loss function leads to blurred reconstructed images. A method for learning CAEs using a loss function computed from features reflecting spatial frequencies is proposed to mitigate the problem. The blurs in reconstructed images show lack of high spatial frequency components mainly constituting edges and detailed textures that are important features for tasks such as object detection and spatial matching. In order to evaluate the lack of components, a convolutional layer with a Laplacian filter bank as weights is added to CAEs and the mean squared error of features in a subband, called the spatial frequency loss (SFL), is computed from the outputs of each filter. The learning is performed using a loss function based on the SFL. Empirical evaluation demonstrates that using the SFL reduces the blurs in reconstructed images.

研究动机与目标

  • 解决使用标准像素损失(PL)训练的卷积自编码器(CAEs)在图像重建中出现的模糊问题。
  • 通过保留如边缘和纹理等高空间频率分量,提升目标检测和空间匹配等任务的特征提取性能。
  • 开发一种轻量化、高效的损失函数,明确针对高频内容,且无需对抗性训练。
  • 通过学习的拉普拉斯滤波器组实现频率特定的监督,使CAEs能够重建精细细节。
  • 证明显式建模空间频率分量可显著提升图像重建质量,优于基于PL的训练方法。

提出的方法

  • 在CAE中将具有多尺度(σc = 0.8, 1.6, 3.2)的拉普拉斯滤波器组作为卷积层应用,以提取反映空间频率的子带特征。
  • 空间频率损失(SFL)计算为原始图像与重建图像在每个子带中的特征图之间的均方误差。
  • 总损失通过加权和结合SFL与像素损失(PL):E_total = w_PL × E_PL + w_SFL × E_SFL,其中高频子带赋予更高的权重。
  • 使用动量的反向传播进行网络训练(学习率 0.02,动量 0.5),滤波器权重初始化为N(0, 0.02),偏置设为零。
  • SFL按子带分别计算,并反向传播以引导网络学习,从而保留高频分量。
  • 该方法使用C++实现,并通过CUDA实现GPU加速,训练时间与标准PL训练相当(约214秒/epoch)。

实验结果

研究问题

  • RQ1与标准像素损失相比,对高频空间频率分量进行显式监督是否能有效减少CAE重建中的模糊现象?
  • RQ2使用拉普拉斯滤波器组提取子带特征,是否能更有效地在重建图像中保留边缘和纹理?
  • RQ3在高频分量重建方面,所提出的基于SFL的训练方法与像素损失相比在定量上表现如何?
  • RQ4SFL损失是否能以极低的计算开销高效集成到CAEs中?
  • RQ5SFL与PL的结合是否会导致重建质量的权衡?若有,如何实现平衡?

主要发现

  • 在2000个训练周期后,最高子带(σc = 0.8)的SFL从18.9 × 10⁻³降低至7.08 × 10⁻³,表明高频分量重建性能显著提升。
  • 中等子带(σc = 1.6)的SFL从5.69 × 10⁻³降至2.65 × 10⁻³,表明中频细节的保留效果更优。
  • 最低子带(σc = 3.2)的SFL从1.37 × 10⁻³降至1.34 × 10⁻³,表明低频内容几乎未发生退化。
  • 图6和图7的定性结果表明,所提方法生成的图像更清晰,边缘和纹理恢复效果优于基于PL的训练方法。
  • 学习曲线(图5)证实,尽管PL损失迅速下降,但在PL训练下SFL保持较高水平,解释了观察到的模糊现象;相比之下,所提方法下SFL稳步下降。
  • 该方法仅带来少量训练时间增加,即实现了更高的重建质量,证明了其高效性与实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。