Skip to main content
QUICK REVIEW

[论文解读] Basis Prediction Networks for Effective Burst Denoising with Large Kernels

Zhihao Xia, Federico Perazzi|arXiv (Cornell University)|Dec 9, 2019
Image and Signal Denoising Methods参考文献 40被引用 7
一句话总结

本文提出基函数预测网络(Basis Prediction Networks, BPNs)用于图像帧序列去噪,通过将大尺寸的逐像素去噪核表示为共享全局基函数与逐像素系数的线性组合,降低输出维度,从而实现高效且高质量的大核去噪。该方法在保持时序自相似性的同时,相比最先进核预测网络(KPNs)实现超过1 dB的PSNR增益,并具备更快的推理速度。

ABSTRACT

Bursts of images exhibit significant self-similarity across both time and space. This motivates a representation of the kernels as linear combinations of a small set of basis elements. To this end, we introduce a novel basis prediction network that, given an input burst, predicts a set of global basis kernels -- shared within the image -- and the corresponding mixing coefficients -- which are specific to individual pixels. Compared to state-of-the-art techniques that output a large tensor of per-pixel spatiotemporal kernels, our formulation substantially reduces the dimensionality of the network output. This allows us to effectively exploit comparatively larger denoising kernels, achieving both significant quality improvements (over 1dB PSNR) and faster run-times over state-of-the-art methods.

研究动机与目标

  • 解决核预测网络(KPNs)在帧序列去噪中因生成高维逐像素核而导致的高内存与计算开销问题。
  • 利用图像帧序列中强自相似性(时空维度)以降低核表示的复杂度。
  • 在保持效率与训练稳定性的同时,实现更大去噪核的使用以提升噪声抑制能力。
  • 提出一种降低去噪网络输出维度的方法,且不损失性能。
  • 通过结构化核输出实现傅里叶域滤波,从而提升推理速度与内存效率。

提出的方法

  • 该方法提出基函数预测网络(BPNs),联合预测大小为B的全局基函数集合与每个像素对应的长度为B的逐像素系数向量。
  • 每个像素的去噪核通过加权全局基函数线性组合重建,权重由预测的逐像素系数决定。
  • 基函数头与系数头均通过深度神经网络实现,处理输入帧序列以生成这两类输出。
  • 最终的去噪步骤通过利用预测核的低秩结构,在傅里叶域高效完成。
  • 网络采用像素级L2损失,端到端训练,比较预测去噪图像与真实去噪图像。
  • 针对彩色去噪,方法将基函数扩展至包含颜色通道,生成3K²T×B的基矩阵,并为每个像素生成独立的系数向量。

实验结果

研究问题

  • RQ1能否通过低维基函数表示逐像素去噪核,有效捕捉图像帧序列中的时空结构?
  • RQ2降低核预测网络的输出维度是否能在不降低去噪质量的前提下提升训练稳定性与推理效率?
  • RQ3当核输出被约束在低维子空间时,能否有效使用大尺寸去噪核进行帧序列去噪?
  • RQ4所提出的基于基函数的核表示方法与标准KPNs相比,在PSNR、FLOPs与运行时间方面表现如何?
  • RQ5该方法能否在保持效率与性能增益的同时,泛化至彩色图像去噪?

主要发现

  • 所提出的BPN方法在灰度与彩色测试集的所有噪声水平下,相比最先进KPNs实现超过1 dB的PSNR增益。
  • 在1024×768图像上,BPN因优化的傅里叶域滤波与更优缓存利用,推理速度超过KPN与可分离KPN。
  • 通过利用预测核的低秩结构,该方法显著降低了核滤波所需的FLOPs数量。
  • 预测核的可视化显示,其在各帧间分布更均匀,并与运动模式对齐,而KPNs通常偏向少数帧。
  • 逐像素系数的聚类分析揭示了有意义的空间结构,如水平与垂直边缘,证实该方法学习到了语义上有意义的表示。
  • 该方法在彩色帧序列去噪中表现良好,所有噪声水平下均保持超过1 dB的PSNR增益,优于KPNs。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。