Skip to main content
QUICK REVIEW

[论文解读] MISF: Multi-level Interactive Siamese Filtering for High-Fidelity Image Inpainting

Xiaoguang Li, Qing Guo|arXiv (Cornell University)|Mar 12, 2022
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

本文提出了一种新型图像修复框架——多级交互孪生滤波(Multi-level Interactive Siamese Filtering, MISF),通过两个相互关联的分支——卷积核预测分支(Kernel Prediction Branch, KPB)和语义与图像滤波分支(Semantic & Image Filtering Branch, SIFB)——联合执行动态图像级和语义级滤波。通过利用自适应、上下文感知的滤波核以及多级特征融合,MISF在敦煌(Dunhuang)、Places2和CelebA数据集上均取得了最先进性能,显著减少了伪影,并在各类缺失区域和场景类型中提升了重建保真度。

ABSTRACT

Although achieving significant progress, existing deep generative inpainting methods are far from real-world applications due to the low generalization across different scenes. As a result, the generated images usually contain artifacts or the filled pixels differ greatly from the ground truth. Image-level predictive filtering is a widely used image restoration technique, predicting suitable kernels adaptively according to different input scenes. Inspired by this inherent advantage, we explore the possibility of addressing image inpainting as a filtering task. To this end, we first study the advantages and challenges of image-level predictive filtering for image inpainting: the method can preserve local structures and avoid artifacts but fails to fill large missing areas. Then, we propose semantic filtering by conducting filtering on the deep feature level, which fills the missing semantic information but fails to recover the details. To address the issues while adopting the respective advantages, we propose a novel filtering technique, i.e., Multilevel Interactive Siamese Filtering (MISF), which contains two branches: kernel prediction branch (KPB) and semantic & image filtering branch (SIFB). These two branches are interactively linked: SIFB provides multi-level features for KPB while KPB predicts dynamic kernels for SIFB. As a result, the final method takes the advantage of effective semantic & image-level filling for high-fidelity inpainting. We validate our method on three challenging datasets, i.e., Dunhuang, Places2, and CelebA. Our method outperforms state-of-the-art baselines on four metrics, i.e., L1, PSNR, SSIM, and LPIPS. Please try the released code and model at https://github.com/tsingqguo/misf.

研究动机与目标

  • 为解决现有深度生成式图像修复方法存在的局限性,这些方法常产生伪影,且在多样化场景和缺失区域形状下泛化能力不足。
  • 探索图像级预测滤波在保留局部结构、避免伪影方面的潜力,同时克服其在填充大范围缺失区域时的不足。
  • 将预测滤波扩展至深层特征层面(语义滤波),以恢复大范围语义内容,尽管会损失部分细节。
  • 通过交互式、多级孪生架构整合图像级与语义级滤波,提升重建保真度与泛化能力。
  • 证明通过交互式滤波学习的动态卷积操作可显著优于标准编码器-解码器网络的性能。

提出的方法

  • MISF采用两条并行且相互交互的分支:卷积核预测分支(KPB)与语义与图像滤波分支(SIFB),二者交换多级特征与动态卷积核。
  • KPB基于输入图像及SIFB提供的多级特征,预测自适应、空间可变的滤波核,实现上下文感知滤波。
  • SIFB在像素级与深层特征级均执行滤波操作:图像级滤波用于恢复精细细节,语义级滤波则利用高层表示恢复大范围缺失区域。
  • KPB与SIFB之间的交互为双向:SIFB向KPB提供多级特征以指导卷积核预测,KPB则提供动态卷积核以优化特征与像素重建。
  • 该框架显式建模了邻近像素与特征之间的平滑性先验,实现高保真重建,而无需完全依赖生成建模。
  • 方法通过L1、PSNR、SSIM与LPIPS损失联合端到端训练,并通过消融实验验证了各组件的贡献。

实验结果

研究问题

  • RQ1图像级预测滤波是否能有效减少图像修复中的伪影并保留局部结构?其在处理大范围缺失区域时存在哪些局限性?
  • RQ2在深层特征上进行语义级滤波是否能成功恢复大范围缺失内容?是否以牺牲细粒度细节保真度为代价?
  • RQ3如何有效结合图像级与语义级滤波,以同时实现高保真细节恢复与鲁棒的语义补全?
  • RQ4与标准生成网络相比,MISF的交互式、多级设计在多样化场景与掩码形状下的泛化能力提升程度如何?
  • RQ5相比固定或单层次滤波,通过交互式滤波学习的动态卷积操作在编码器-解码器架构中的贡献有多大?

主要发现

  • MISF在Dunhuang、Places2与CelebA三个数据集上,所有四项指标(L1、PSNR、SSIM、LPIPS)均优于最先进方法。
  • 在Dunhuang数据集上,MISF在F3特征层级实现L1损失0.488、PSNR 1.651、SSIM 3.895与LPIPS 0.0343,表现优异。
  • 消融实验证实,通过MISF结合图像级与语义级滤波的效果优于单一方法,且MISF在所有指标与掩码尺寸下均持续优于Img-Filter与Sem-Filter。
  • 相似性分析表明,经MISF滤波后的特征与真实特征显著更接近,尤其在掩码比例增大时更为明显,验证了滤波机制的有效性。
  • 对比En-decoder、En-decoder-Filter、Sem-Filter与MISF的消融实验表明,更多动态卷积操作(即MISF)带来更优性能,验证了交互式、多级滤波的重要性。
  • 定性结果表明,与RFRNet和JPGNet相比,MISF生成的图像更具自然感、保真度更高,伪影更少,细节更丰富,尤其在大范围缺失区域与复杂场景中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。