[论文解读] High-Resolution Image Inpainting with Iterative Confidence Feedback and Guided Upsampling
本文提出一种基于迭代置信度反馈机制的高分辨率图像修复方法,通过逐步优化大孔洞区域的预测结果,提升视觉质量并减少伪影。通过训练深度生成模型同时预测修复图像与置信度图,该方法在迭代过程中选择性地信任高置信度区域,并结合引导式上采样技术增强高分辨率细节,从而在真实物体移除任务中取得当前最优性能。
Existing image inpainting methods often produce artifacts when dealing with large holes in real applications. To address this challenge, we propose an iterative inpainting method with a feedback mechanism. Specifically, we introduce a deep generative model which not only outputs an inpainting result but also a corresponding confidence map. Using this map as feedback, it progressively fills the hole by trusting only high-confidence pixels inside the hole at each iteration and focuses on the remaining pixels in the next iteration. As it reuses partial predictions from the previous iterations as known pixels, this process gradually improves the result. In addition, we propose a guided upsampling network to enable generation of high-resolution inpainting results. We achieve this by extending the Contextual Attention module to borrow high-resolution feature patches in the input image. Furthermore, to mimic real object removal scenarios, we collect a large object mask dataset and synthesize more realistic training data that better simulates user inputs. Experiments show that our method significantly outperforms existing methods in both quantitative and qualitative evaluations. More results and Web APP are available at https://zengxianyu.github.io/iic.
研究动机与目标
- 为解决在真实世界物体移除场景中,针对大孔洞区域生成逼真高分辨率图像修复结果的挑战。
- 减少现有基于深度学习的修复方法在大孔洞模糊性和结构理解不足时产生的视觉伪影。
- 通过引入置信度反馈环路,基于预测可靠性迭代优化预测结果,提升模型鲁棒性。
- 通过引导式上采样将结构生成与纹理细节重建解耦,提升高分辨率输出质量。
- 通过收集物体形状掩码并合成多样的孔洞模式,构建更接近真实用户输入的训练数据。
提出的方法
- 该方法采用深度生成模型,输出修复图像与置信度图,其中高置信度像素在后续迭代中获得更高信任度。
- 迭代反馈环路利用置信度图识别可靠预测区域,将其视为已知区域,仅重新处理孔洞中剩余的不确定部分。
- 引导式上采样网络通过从输入图像中借用与低分辨率输出相似的高分辨率特征块,重建高分辨率结果。
- 扩展上下文注意力模块,实现在高分辨率下检索特征块,提升最终输出的纹理细节保真度。
- 通过大规模物体掩码数据集增强训练数据,包含前景遮挡与仅背景孔洞两种场景,以模拟真实用户输入。
- 模型采用重建损失与对抗性损失联合训练,置信度预测通过专用的置信度解码头进行鼓励。
实验结果
研究问题
- RQ1基于预测置信度的迭代反馈机制是否能提升大孔洞区域图像修复的质量?
- RQ2与预设的渐进式修复策略相比,基于置信度的渐进式优化在视觉与定量性能上表现如何?
- RQ3利用高分辨率特征的引导式上采样能否提升高分辨率修复结果的逼真度与细节表现?
- RQ4使用真实物体形状的训练数据在多大程度上能提升模型在真实应用中的泛化能力与用户偏好?
- RQ5性能对超参数(如置信度阈值与迭代次数)的敏感度如何?
主要发现
- 所提方法采用迭代置信度反馈(CF)在CelebA-HQ数据集上取得PSNR 28.20与FID 0.8985,优于无置信度反馈的基线模型。
- 迭代置信度反馈机制在高置信度区域显著提升性能(PSNR 36.38,FID 0.981),相比低置信度区域(PSNR 30.00,FID 0.923)表现更优。
- 引入真实训练数据(RT)可提升性能,Ours*模型达到PSNR 27.67与FID 0.8949,显示出对真实用户输入更强的泛化能力。
- 引导式上采样支持高分辨率生成:Ours模型在1024×1024分辨率下生成结果视觉质量更优,纹理细节更丰富,尽管因重建约束导致定量指标略低于Ours*。
- 该方法对超参数变化具有鲁棒性:敏感性分析显示,当λ值在0.7至0.13范围内变化时,PSNR保持稳定(28.1–28.5)。
- 用户研究表明,采用引导式上采样的版本(Ours)比Ours*更受青睐,表明其在感知质量上更优,尽管定量指标略低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。