Skip to main content
QUICK REVIEW

[论文解读] Resolution-robust Large Mask Inpainting with Fourier Convolutions

Roman Suvorov, Elizaveta Logacheva|arXiv (Cornell University)|Sep 15, 2021
Advanced Image Processing Techniques被引用 7
一句话总结

本文提出 LaMa,一种基于快速傅里叶卷积(FFCs)的分辨率鲁棒单阶段图像修复方法,通过在早期网络层即实现全图感受野,从而实现高分辨率图像的高效修复。通过结合基于 FFC 的网络架构、大感受野感知损失以及激进的大掩码数据增强策略,LaMa 在大掩码修复任务上达到当前最优性能,并在推理时有效泛化至训练中未见的更高分辨率图像,且参数量和推理成本均低于先前方法。

ABSTRACT

Modern image inpainting systems, despite the significant progress, often struggle with large missing areas, complex geometric structures, and high-resolution images. We find that one of the main reasons for that is the lack of an effective receptive field in both the inpainting network and the loss function. To alleviate this issue, we propose a new method called large mask inpainting (LaMa). LaMa is based on i) a new inpainting network architecture that uses fast Fourier convolutions (FFCs), which have the image-wide receptive field; ii) a high receptive field perceptual loss; iii) large training masks, which unlocks the potential of the first two components. Our inpainting network improves the state-of-the-art across a range of datasets and achieves excellent performance even in challenging scenarios, e.g. completion of periodic structures. Our model generalizes surprisingly well to resolutions that are higher than those seen at train time, and achieves this at lower parameter&time costs than the competitive baselines. The code is available at \url{https://github.com/saic-mdal/lama}.

研究动机与目标

  • 为解决现有修复模型在处理大掩码和复杂结构,尤其是在高分辨率设置下的局限性。
  • 克服标准卷积神经网络及感知损失中有效感受场不足的问题,从而改善全局结构理解能力。
  • 开发一种单阶段修复框架,在计算成本更低的前提下,超越两阶段或复杂架构的性能表现。
  • 实现在无需高分辨率训练数据的情况下,对高分辨率图像的有效泛化能力。

提出的方法

  • 该方法采用基于快速傅里叶卷积(FFCs)的前馈式、类似残差网络(ResNet)的生成器网络,即使在早期层也能够提供图像级感受野。
  • 采用基于大上下文语义分割主干网络的高感受场感知损失,以确保全局形状与结构的一致性。
  • 采用激进的掩码生成策略,生成宽大、多样且复杂的训练掩码,以充分挖掘模型与损失函数的高感受场能力。
  • 训练采用多组件损失函数,结合对抗性损失(使用 r1 正则化的 PatchGAN 判别器)、感知损失和特征匹配损失。
  • 输入为四通道张量,由掩码图像与二值掩码堆叠而成,使网络能够关注缺失区域。
  • 网络架构仅在低分辨率(256×256)数据上进行训练,但在推理时能有效泛化至更高分辨率。

实验结果

研究问题

  • RQ1单阶段图像修复模型是否能在无需中间监督或复杂设计的前提下,实现大掩码上的最先进性能?
  • RQ2基于傅里叶卷积的高感受场架构在未见高分辨率图像上的泛化能力方面有何提升?
  • RQ3具有大上下文的感知损失在修复任务中对全局图像结构建模的改善程度如何?
  • RQ4激进的大掩码数据增强是否显著提升了模型对高感受场组件的利用能力?
  • RQ5与标准卷积相比,基于 FFC 的网络是否能更好地捕捉和生成周期性或重复性视觉模式?

主要发现

  • LaMa 在多个基准数据集上均达到最先进性能,尤其在具有挑战性的大掩码与复杂结构场景中表现优异。
  • 即使仅在 256×256 图像上进行训练,模型在高达 4K 分辨率的图像上也表现出极强的泛化能力,展现出显著的分辨率鲁棒性。
  • LaMa 在周期性与重复性结构的修复上表现优越,而这些结构常为先前方法所难以处理。
  • 与 DCT-Net 和 SIREN 等竞争基线相比,LaMa 所需参数量减少 30%-50%,且推理时间更短。
  • 消融实验证实,FFC 架构、高感受场损失与激进掩码生成策略均对性能有显著贡献。
  • 模型在自由形状与物体形状掩码上均保持强大性能,表明其对掩码多样性的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。