[论文解读] PIP: Positional-encoding Image Prior
本文提出位置编码图像先验(PIP),一种新颖的框架,用傅里叶特征(位置编码)替代深度图像先验(DIP)中的随机潜在代码,使简单的像素级MLP能够实现与DIP的CNN相当的性能,同时参数量显著减少。PIP在图像和视频恢复任务中达到最先进水平,尤其在视频去噪和超分辨率任务中表现卓越,而3D-DIP因不稳定而失效。
In Deep Image Prior (DIP), a Convolutional Neural Network (CNN) is fitted to map a latent space to a degraded (e.g. noisy) image but in the process learns to reconstruct the clean image. This phenomenon is attributed to CNN's internal image-prior. We revisit the DIP framework, examining it from the perspective of a neural implicit representation. Motivated by this perspective, we replace the random or learned latent with Fourier-Features (Positional Encoding). We show that thanks to the Fourier features properties, we can replace the convolution layers with simple pixel-level MLPs. We name this scheme ``Positional Encoding Image Prior" (PIP) and exhibit that it performs very similarly to DIP on various image-reconstruction tasks with much less parameters required. Additionally, we demonstrate that PIP can be easily extended to videos, where 3D-DIP struggles and suffers from instability. Code and additional examples for all tasks, including videos, are available on the project page https://nimrodshabtay.github.io/PIP/
研究动机与目标
- 将深度图像先验(DIP)重新解释为将结构化噪声映射到RGB值的神经隐式模型。
- 探究位置编码(傅里叶特征)是否可替代DIP中的随机潜在代码,同时保持其图像先验效果。
- 开发一种基于MLP与傅里叶特征的参数高效替代方案,降低模型复杂度。
- 将框架扩展至视频恢复任务,克服3D-DIP在时间一致性与稳定性方面的局限。
- 证明PIP在图像与视频任务中具有良好的泛化能力,包括去噪、超分辨率和CLIP反演。
提出的方法
- 用傅里叶特征(位置编码)替换DIP中的随机潜在输入,以编码空间坐标。
- 使用简单的像素级MLP(1×1卷积)替代深层CNN,利用傅里叶特征的谱偏差校正能力。
- 在线性网络情况下,证明使用傅里叶特征的MLP与使用随机输入的CNN具有等价性。
- 通过引入时间位置编码,将2D-PIP框架扩展至3D,以支持视频任务。
- 保留跳跃连接与U-Net结构以保持特征层次,同时用MLP替代卷积层。
- 端到端训练模型,将编码坐标映射到RGB像素值,使用早停法进行正则化。
实验结果
研究问题
- RQ1傅里叶特征能否有效替代DIP中的随机潜在代码,同时保持其图像先验能力?
- RQ2在使用位置编码时,是否可将DIP中的卷积编码器替换为简单的MLP?
- RQ3PIP在模型复杂度降低的情况下,是否能实现与DIP相当或更优的图像恢复性能?
- RQ4PIP能否有效扩展至视频恢复任务,其中3D-DIP因不稳定与时间一致性差而表现不佳?
- RQ5PIP中使用位置编码是否能解释NeRF及其类似隐式模型在处理噪声或稀疏输入时的成功?
主要发现
- 在视频去噪任务中,PIP实现PSNR 29.29与3D-SSIM 0.90,相比3D-DIP提升+3dB(PSNR)与+0.08(3D-SSIM)。
- 3D-PIP的参数量相比3D-DIP减少6倍,同时实现更优的重建质量与时间一致性。
- 在图像去噪(σ=25)中,PIP实现PSNR 26.17,与DIP的26.35性能相当,但参数显著更少。
- 在超分辨率(x4)任务中,PIP实现PSNR 25.45与3D-SSIM 0.78,与DIP的25.54与0.81相当。
- 3D-PIP在视频任务中优于2D-DIP与2D-PIP,证明其在时间一致性与重建质量上的优越性。
- 使用PIP进行CLIP反演生成的图像质量高,视觉上与DIP生成结果相似,验证了其生成能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。