[论文解读] Deep Generative Model for Image Inpainting with Local Binary Pattern Learning and Spatial Attention
该论文提出了一种两阶段深度生成模型用于图像修复,首先通过基于U-Net的LBP学习网络预测缺失区域的局部二值模式(LBP)特征,然后利用这些特征引导空间注意力图像修复网络。新颖的空间注意力机制不仅建模了已知区域与生成区域之间的依赖关系,还建模了生成区域内部的依赖关系,显著减少了伪影并提高了结构一致性,在CelebA-HQ、Places和Paris StreetView数据集上优于最先进方法。
Deep learning (DL) has demonstrated its powerful capabilities in the field of image inpainting. The DL-based image inpainting approaches can produce visually plausible results, but often generate various unpleasant artifacts, especially in the boundary and highly textured regions. To tackle this challenge, in this work, we propose a new end-to-end, two-stage (coarse-to-fine) generative model through combining a local binary pattern (LBP) learning network with an actual inpainting network. Specifically, the first LBP learning network using U-Net architecture is designed to accurately predict the structural information of the missing region, which subsequently guides the second image inpainting network for better filling the missing pixels. Furthermore, an improved spatial attention mechanism is integrated in the image inpainting network, by considering the consistency not only between the known region with the generated one, but also within the generated region itself. Extensive experiments on public datasets including CelebA-HQ, Places and Paris StreetView demonstrate that our model generates better inpainting results than the state-of-the-art competing algorithms, both quantitatively and qualitatively. The source code and trained models will be made available at https://github.com/HighwayWu/ImageInpainting.
研究动机与目标
- 为解决基于深度学习的图像修复中持续存在的伪影和结构不一致问题,尤其是在纹理区域和边界区域的问题。
- 通过利用LBP特征提供的结构先验,提升修复区域的全局与局部一致性。
- 通过新型空间注意力机制建模生成区域内部的依赖关系,增强特征表示能力。
- 通过在多个网络层上应用多级损失函数,稳定训练过程并提升特征保真度。
- 在公开基准数据集上实现定性和定量评估中的最先进性能。
提出的方法
- 采用两阶段框架:首先,基于U-Net的LBP学习网络利用已知上下文预测缺失区域的LBP特征图。
- 将预测的LBP特征作为结构先验,引导后续图像修复网络生成语义合理且结构一致的内容。
- 在修复网络中集成一种新型空间注意力机制,同时建模跨区域依赖(已知区域与生成区域之间)和区域内部依赖(生成区域内部),以提升一致性。
- 注意力机制在32×32特征分辨率上运行,每个token包含T=2个补丁,兼顾效率与性能。
- 在多个编码器-解码器层上应用多级损失函数,以优化特征保真度并提升训练稳定性。
- 与上述组件联合训练生成对抗网络(GAN),以增强真实感和感知质量。
实验结果
研究问题
- RQ1LBP特征能否作为有效的、无需调参的结构先验,用于引导图像修复并减少伪影?
- RQ2与现有注意力机制相比,建模生成区域内部依赖关系是否能显著提升结构一致性?
- RQ3所提出的两阶段、粗到精框架在视觉质量与定量指标上与端到端的GAN方法相比表现如何?
- RQ4多级损失在多大程度上提升了特征重建效果与最终修复性能?
- RQ5所提出的模型能否在包括人脸、自然场景和街景在内的多样化图像领域中实现良好泛化?
主要发现
- 在使用中心遮罩的Places数据集上,与无多级损失的基线相比,所提模型的PSNR提升了约0.11 dB。
- 在Places数据集上,采用多级损失时,PSNR达到24.31,SSIM达到0.845,优于未使用多级损失的版本(PSNR: 24.20,SSIM: 0.844)。
- 在CelebA-HQ、Places和Paris StreetView上的定性结果表明,相比最先进方法,边界伪影更少,纹理一致性更优。
- 消融实验证实,所提出的建模内部依赖的空间注意力机制显著提升了局部一致性并减少了幻觉现象。
- 将LBP作为结构先验的集成,显著提升了复杂区域(如人脸和纹理区域)的结构重建准确性。
- 该模型在多样化数据集(包括人脸图像、自然场景和城市街景)上表现出强大的泛化能力,生成结果在视觉上合理且语义一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。