[论文解读] TransFill: Reference-guided Image Inpainting by Merging Multiple Color and Spatial Transformations
TransFill 提出了一种基于参考图像的图像修复方法,通过使用多个单应变换将源图像对齐到带孔的目标图像,应用学习到的颜色和空间变换以保持一致性,然后通过学习到的掩码融合结果。该方法通过结合基于深度的单应变换估计、双边颜色变换和多提案融合,在处理具有视差、光照差异和大形变的复杂孔洞时实现了最先进性能。
Image inpainting is the task of plausibly restoring missing pixels within a hole region that is to be removed from a target image. Most existing technologies exploit patch similarities within the image, or leverage large-scale training data to fill the hole using learned semantic and texture information. However, due to the ill-posed nature of the inpainting task, such methods struggle to complete larger holes containing complicated scenes. In this paper, we propose TransFill, a multi-homography transformed fusion method to fill the hole by referring to another source image that shares scene contents with the target image. We first align the source image to the target image by estimating multiple homographies guided by different depth levels. We then learn to adjust the color and apply a pixel-level warping to each homography-warped source image to make it more consistent with the target. Finally, a pixel-level fusion module is learned to selectively merge the different proposals. Our method achieves state-of-the-art performance on pairs of images across a variety of wide baselines and color differences, and generalizes to user-provided image pairs.
研究动机与目标
- 解决在自相似性或单图像生成失效时,填充大而复杂孔洞的挑战。
- 在存在显著视角变化和光照差异的情况下,当同一场景的参考图像可用时,实现鲁棒的图像修复。
- 通过使用多个基于深度估计的单应变换,克服全局单应变换的局限性,以建模视差。
- 通过端到端学习的颜色和空间变换,提升源图像与目标图像之间的视觉一致性。
- 通过融合多个变换后的提案并应用单图像修复作为备份,实现因遮挡或形变导致像素缺失区域的高质量修复。
提出的方法
- 在目标图像和源图像之间估计特征对应点,然后按深度聚类内点,以推断多个深度平面。
- 针对每个深度聚类,计算单应变换以将源图像注册到目标图像,生成多个初始对齐提案。
- 对每个提案应用深度双边颜色变换,以协调源图像与目标图像之间的颜色分布。
- 学习逐像素的空间变换(形变)以优化对齐并校正残余几何失真。
- 训练一个融合网络,学习逐像素权重,将多个变换后的提案融合为单一连贯输出。
- 集成一个预训练的单图像修复模型(ProFill),用于填补形变后缺失的区域,融合权重通过学习方式与多提案结果结合。

实验结果
研究问题
- RQ1与单一全局单应变换相比,使用多个分别对齐于不同深度平面的单应变换,是否能提升在具有视差的大孔洞上的图像修复性能?
- RQ2学习到的颜色和空间变换在将光照和曝光不同的源图像与目标图像对齐方面有多有效?
- RQ3使用可学习融合掩码融合多个变换后的源图像提案,是否能优于单个或未加权的融合方法?
- RQ4该方法在用户提供的图像对中,面对大视角差异和复杂场景布局时,泛化能力如何?
- RQ5集成单图像修复模型在源图像内容因形变而缺失的区域中,能在多大程度上提升修复效果?
主要发现
- 在 RealEstate10K 数据集上,当帧位移为 10 时,TransFill 实现了 39.59 的 PSNR、0.9919 的 SSIM 和 0.0116 的 LPIPS,优于先前最先进方法。
- 当帧位移为 30 时,TransFill 仍保持 35.62 的 PSNR 和 0.0213 的 LPIPS,表明对大几何位移具有强鲁棒性。
- 基于深度的特征点聚类用于单应变换估计优于随机聚类和空间聚类,在使用五个单应变换时达到 37.576 的 PSNR。
- 色彩-空间变换模块至关重要:移除任一模块(颜色或空间)均导致 PSNR 下降超过 1.0,表明二者具有互补作用。
- 完整流程(CST + SPF)在同时使用色彩-空间变换和融合网络时表现最佳(PSNR 为 37.576),显著优于缺少这些组件的消融实验。
- 在用户研究中,TransFill 的偏好率达到 95.65%,p < 10^-6,表明用户对其结果有显著偏好。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。