Skip to main content
QUICK REVIEW

[论文解读] PIP: Positional-encoding Image Prior

Nimrod Shabtay, Eli Schwartz|arXiv (Cornell University)|Nov 25, 2022
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

本文提出位置编码图像先验(PIP),一种新颖的框架,用傅里叶特征(位置编码)替代深度图像先验(DIP)中的随机潜在代码,使简单的像素级MLP能够实现与DIP的CNN相当的性能,同时参数量显著减少。PIP在图像和视频恢复任务中达到最先进水平,尤其在视频去噪和超分辨率任务中表现卓越,而3D-DIP因不稳定而失效。

ABSTRACT

In Deep Image Prior (DIP), a Convolutional Neural Network (CNN) is fitted to map a latent space to a degraded (e.g. noisy) image but in the process learns to reconstruct the clean image. This phenomenon is attributed to CNN's internal image-prior. We revisit the DIP framework, examining it from the perspective of a neural implicit representation. Motivated by this perspective, we replace the random or learned latent with Fourier-Features (Positional Encoding). We show that thanks to the Fourier features properties, we can replace the convolution layers with simple pixel-level MLPs. We name this scheme ``Positional Encoding Image Prior" (PIP) and exhibit that it performs very similarly to DIP on various image-reconstruction tasks with much less parameters required. Additionally, we demonstrate that PIP can be easily extended to videos, where 3D-DIP struggles and suffers from instability. Code and additional examples for all tasks, including videos, are available on the project page https://nimrodshabtay.github.io/PIP/

研究动机与目标

  • 将深度图像先验(DIP)重新解释为将结构化噪声映射到RGB值的神经隐式模型。
  • 探究位置编码(傅里叶特征)是否可替代DIP中的随机潜在代码,同时保持其图像先验效果。
  • 开发一种基于MLP与傅里叶特征的参数高效替代方案,降低模型复杂度。
  • 将框架扩展至视频恢复任务,克服3D-DIP在时间一致性与稳定性方面的局限。
  • 证明PIP在图像与视频任务中具有良好的泛化能力,包括去噪、超分辨率和CLIP反演。

提出的方法

  • 用傅里叶特征(位置编码)替换DIP中的随机潜在输入,以编码空间坐标。
  • 使用简单的像素级MLP(1×1卷积)替代深层CNN,利用傅里叶特征的谱偏差校正能力。
  • 在线性网络情况下,证明使用傅里叶特征的MLP与使用随机输入的CNN具有等价性。
  • 通过引入时间位置编码,将2D-PIP框架扩展至3D,以支持视频任务。
  • 保留跳跃连接与U-Net结构以保持特征层次,同时用MLP替代卷积层。
  • 端到端训练模型,将编码坐标映射到RGB像素值,使用早停法进行正则化。

实验结果

研究问题

  • RQ1傅里叶特征能否有效替代DIP中的随机潜在代码,同时保持其图像先验能力?
  • RQ2在使用位置编码时,是否可将DIP中的卷积编码器替换为简单的MLP?
  • RQ3PIP在模型复杂度降低的情况下,是否能实现与DIP相当或更优的图像恢复性能?
  • RQ4PIP能否有效扩展至视频恢复任务,其中3D-DIP因不稳定与时间一致性差而表现不佳?
  • RQ5PIP中使用位置编码是否能解释NeRF及其类似隐式模型在处理噪声或稀疏输入时的成功?

主要发现

  • 在视频去噪任务中,PIP实现PSNR 29.29与3D-SSIM 0.90,相比3D-DIP提升+3dB(PSNR)与+0.08(3D-SSIM)。
  • 3D-PIP的参数量相比3D-DIP减少6倍,同时实现更优的重建质量与时间一致性。
  • 在图像去噪(σ=25)中,PIP实现PSNR 26.17,与DIP的26.35性能相当,但参数显著更少。
  • 在超分辨率(x4)任务中,PIP实现PSNR 25.45与3D-SSIM 0.78,与DIP的25.54与0.81相当。
  • 3D-PIP在视频任务中优于2D-DIP与2D-PIP,证明其在时间一致性与重建质量上的优越性。
  • 使用PIP进行CLIP反演生成的图像质量高,视觉上与DIP生成结果相似,验证了其生成能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。