[论文解读] The Spectral Bias of the Deep Image Prior
本文通过证明卷积编码器-解码器网络表现出谱偏差(spectral bias),即在优化过程中优先学习图像的低频分量,从而解释了深度图像先验(DIP)去噪成功的原理。因此,早停(early stopping)起到了低通滤波器的作用,抑制了通常为高频的噪声,同时保留了干净图像的结构。
The "deep image prior" proposed by Ulyanov et al. is an intriguing property of neural nets: a convolutional encoder-decoder network can be used as a prior for natural images. The network architecture implicitly introduces a bias; If we train the model to map white noise to a corrupted image, this bias guides the model to fit the true image before fitting the corrupted regions. This paper explores why the deep image prior helps in denoising natural images. We present a novel method to analyze trajectories generated by the deep image prior optimization and demonstrate: (i) convolution layers of the an encoder-decoder decouple the frequency components of the image, learning each at different rates (ii) the model fits lower frequencies first, making early stopping behave as a low pass filter. The experiments study an extension of Cheng et al which showed that at initialization, the deep image prior is equivalent to a stationary Gaussian process.
研究动机与目标
- 解释为何深度图像先验(DIP)在无显式训练数据的情况下仍能有效去除自然图像中的噪声。
- 研究DIP的成功是否源于网络架构中基于频率的归纳偏置。
- 通过在频域分析优化轨迹,确定频率分量被学习的顺序。
- 比较卷积层与全连接层在频率学习动态和去噪性能方面的差异。
- 评估上采样操作对谱偏差及优化过程中模型行为的影响。
提出的方法
- 在1D和2D设置下追踪DIP的优化轨迹,通过测量两次独立运行之间平方误差和(SSE)的变化来检测收敛点。
- 使用谱分析检查频率分量(低频与高频)随时间的学习情况,识别出不同的收敛速率。
- 将DIP中的卷积层替换为全连接层,以测试频率解耦是否为卷积固有的特性。
- 通过分析其频率响应和对输出平滑性的影响,评估不同上采样方法(最近邻和双线性)的效果。
- 训练模型将噪声输入映射为图像,并在整个优化轨迹中记录PSNR以评估去噪性能。
- 应用F-principle框架,表明DIP优先学习低频分量,与深度网络中已知的谱偏差一致。
实验结果
研究问题
- RQ1在优化过程中,深度图像先验(DIP)是否优先学习图像的低频分量而非高频分量?
- RQ2与全连接层相比,卷积层的谱偏差在频率学习顺序上有何差异?
- RQ3上采样操作(如步长)在多大程度上影响谱偏差和生成图像的平滑性?
- RQ4DIP的去噪行为是否可归因于其频率偏差?这是否解释了早停的有效性?
- RQ5在何种条件下DIP会失效?这种失效是否与低频噪声的存在有关?
主要发现
- DIP优先学习图像的低频分量,在1D信号中,低频分量在45次迭代时收敛,而高频分量则在151次迭代时收敛。
- 当全连接层取代卷积层时,两类频率分量以相同速率被学习,且未出现低频重建,表明谱偏差消失。
- 即使参数容量更高,使用全连接层的DIP去噪性能显著更差(PSNR:20.54–27.58),而标准DIP的PSNR为27.47,这是由于缺乏频率解耦。
- 具有ReLU激活函数和全连接层的ReLUNet模型在PSNR上与标准DIP表现相当,表明激活函数引起的频率偏差可替代卷积的归纳偏置。
- 较大的上采样步长(如32)会产生更平滑的输出,并且比小步长(如4)更慢地减少功率谱低频区域的误差,表明谱偏差更强。
- 当图像中存在低频噪声(如barbara.png)时,DIP会失效,因为模型在早期迭代中优先拟合噪声而非真实的高频内容,证实当噪声与信号在频谱上对齐时,谱偏差不足以保证成功。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。