[论文解读] Revisiting Implicit Neural Representations in Low-Level Vision
该论文提出LINR,一种利用隐式神经表示(INR)进行低层次图像修复的新方法,通过在受损输入的像素坐标上训练多层感知机(MLP)来参数化干净图像。LINR在去噪、超分辨率、图像修复和去模糊任务中均达到最先进性能,在有限数据设置下PSNR提升超过2 dB,且在联合训练多种退化类型时表现出惊人性能提升。
Implicit Neural Representation (INR) has been emerging in computer vision in recent years. It has been shown to be effective in parameterising continuous signals such as dense 3D models from discrete image data, e.g. the neural radius field (NeRF). However, INR is under-explored in 2D image processing tasks. Considering the basic definition and the structure of INR, we are interested in its effectiveness in low-level vision problems such as image restoration. In this work, we revisit INR and investigate its application in low-level image restoration tasks including image denoising, super-resolution, inpainting, and deblurring. Extensive experimental evaluations suggest the superior performance of INR in several low-level vision tasks with limited resources, outperforming its counterparts by over 2dB. Code and models are available at https://github.com/WenTXuL/LINR
研究动机与目标
- 探究隐式神经表示(INR)在图像去噪、超分辨率、图像修复和去模糊等低层次视觉任务中的有效性。
- 解决在缺乏成对训练数据(尤其在单张图像设置下无真实干净图像)时的图像修复挑战。
- 探索基于INR的模型是否能在无需针对特定任务调整网络结构的情况下,泛化于多种低层次视觉任务。
- 评估在多种退化类型上联合训练的影响,挑战“混合退化会降低性能”的假设。
提出的方法
- LINR使用多层感知机(MLP)将潜在干净图像隐式表示为像素坐标的连续函数,将(x, y)映射到RGB值。
- 通过在采样像素位置上最小化MLP输出与观测到的受损图像之间的重建损失,实现端到端优化。
- 采用SIREN激活函数,以有效参数化复杂图像信号,克服标准ReLU激活MLP的局限性。
- 训练仅需每样本一张受损图像,无需大规模成对数据集,与Deep Image Prior(DIP)类似。
- 对于联合训练,模型在同一样本的多个不同退化版本上进行优化,每个版本具有不同的退化类型(如噪声和模糊)。
- 优化过程通过MLP的归纳偏置隐式学习高质量图像表示,而非直接学习从受损到干净图像的映射。
实验结果
研究问题
- RQ1仅使用单张受损图像,隐式神经表示(INR)能否在去噪、超分辨率、图像修复和去模糊等任务中有效恢复低层次图像细节?
- RQ2在数据和资源受限条件下,基于INR的方法(LINR)是否优于现有的单图像修复方法(如DIP和S2S)?
- RQ3在多种退化类型(如噪声和模糊)上联合训练,相较于单退化类型训练,对基于INR的图像修复性能有何影响?
- RQ4LINR是否无需架构修改即可泛化于多种不同的低层次视觉任务,表明INR表示具有内在鲁棒性?
主要发现
- 在超分辨率任务中(Set5,×4),LINR的PSNR达到31.20,相比DIP(26.40)提升4.6 dB,优于所有基线方法。
- 在10%稀疏度的图像修复任务中,LINR的PSNR达到26.85,显著优于DIP(24.57)和S2S(21.68)。
- 在高斯模糊(σ=1.6)的去模糊任务中,LINR的平均PSNR为31.20,超过DIP(29.03)和DeepRED(30.35)。
- 在多种退化类型上联合训练的PSNR为30.98,高于单退化训练(去噪:27.63,超分辨率:28.60),表明存在协同特征学习。
- LINR在无需架构修改的情况下,有效泛化于四种不同的低层次视觉任务,证明INR在图像修复中的强大通用性。
- 该方法对退化多样性表现出鲁棒性,尽管存在冲突的退化类型,联合优化仍能提升性能,挑战了关于退化干扰的传统假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。