[论文解读] WaveFill: A Wavelet-based Generation Network for Image Inpainting
WaveFill 提出了一种基于小波的图像修复网络,通过离散小波变换(DWT)将图像分解为不同频带,实现对低频结构的L1损失单独优化与对高频细节的对抗性损失优化。这种频带解耦方法缓解了跨频带冲突,新颖的频带区域注意归一化(FRAN)模块确保了各频带间特征的一致性,在多个基准测试中均实现了最先进性能,无论在定性还是定量评估上表现优异。
Image inpainting aims to complete the missing or corrupted regions of images with realistic contents. The prevalent approaches adopt a hybrid objective of reconstruction and perceptual quality by using generative adversarial networks. However, the reconstruction loss and adversarial loss focus on synthesizing contents of different frequencies and simply applying them together often leads to inter-frequency conflicts and compromised inpainting. This paper presents WaveFill, a wavelet-based inpainting network that decomposes images into multiple frequency bands and fills the missing regions in each frequency band separately and explicitly. WaveFill decomposes images by using discrete wavelet transform (DWT) that preserves spatial information naturally. It applies L1 reconstruction loss to the decomposed low-frequency bands and adversarial loss to high-frequency bands, hence effectively mitigate inter-frequency conflicts while completing images in spatial domain. To address the inpainting inconsistency in different frequency bands and fuse features with distinct statistics, we design a novel normalization scheme that aligns and fuses the multi-frequency features effectively. Extensive experiments over multiple datasets show that WaveFill achieves superior image inpainting qualitatively and quantitatively.
研究动机与目标
- 为解决在空间域中同时优化重建损失与对抗性损失所导致的感知-失真权衡问题。
- 减少当L1损失与对抗性损失联合应用于纠缠的空间特征时产生的跨频带冲突。
- 在图像补全过程中提升不同频带之间的结构与纹理一致性。
- 开发一种归一化机制,有效对齐并融合多频带特征,以抑制伪影并保留细节。
- 在包含矩形与自由形状掩码的多样化数据集上实现卓越的修复结果。
提出的方法
- 网络使用二维离散小波变换(DWT)将输入图像分解为低频(LF)、二级高频(Lv2-HF)和一级高频(Lv1-HF)频带,同时保留空间信息。
- 低频带通过门控残差块(GC ResBlock)使用L1重建损失进行补全,而高频带则通过对抗性损失处理以增强纹理真实感。
- 引入一种新颖的频带区域注意归一化(FRAN)模块,从低频向高频进行注意力建模,对齐并融合多频带特征,实现一致的生成。
- 来自不同频带分支的特征通过FRAN传播,该模块基于频带特定的统计信息计算注意力图,以指导特征融合。
- 通过逆向离散小波变换(IDWT)将补全后的频带重构回空间域,生成最终的修复图像。
- 框架采用端到端训练,损失函数结合了低频带的L1损失与高频带的对抗性损失。
实验结果
研究问题
- RQ1在频带间分离重建损失与感知损失的优化,是否能有效减少图像修复中的跨频带冲突?
- RQ2与空间域或基于DCT的方法相比,基于小波的频带分解在保留结构与纹理细节方面表现如何?
- RQ3一种频带感知的归一化方案是否能改善多频带分支之间的特征对齐与一致性?
- RQ4所提出的FRAN模块是否能有效抑制伪影并保留图像补全过程中的细粒度纹理细节?
- RQ5WaveFill在不同掩码类型下的多样化修复基准测试中,相较于最先进方法的性能提升程度如何?
主要发现
- 在巴黎街景验证集上,WaveFill 使用不规则掩码时的 Fréchet Inception Distance(FID)达到 31.02,优于基线模型(33.95)与基于DCT的模型(100.93)。
- 在同一基准上,模型的 PSNR 达到 28.94,SSIM 达到 0.904,表明其在结构与感知质量方面表现更优。
- 用户研究表明,在巴黎街景数据集上,WaveFill 被评为最真实的修复结果的比例为 68.0%;在 Places2 上为 72.0%,在 CelebA-HQ 上为 70.0%,显著优于竞争模型。
- 消融实验证实,与基于DCT和空间域基线相比,小波分解能显著提升性能,FID 从 100.93(DCT)降至 31.02(WaveFill + FRAN)。
- FRAN 模块有效减少伪影并提升语义一致性,视觉对比显示 WaveFill 产生的失真更少、纹理更锐利,优于 GC、GMCNN 与 EC 模型。
- 小波分解与 FRAN 的结合使 FID 相比使用特征拼接的基线模型降低 2.5%,PSNR 提升 0.5 dB。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。