Skip to main content
QUICK REVIEW

[论文解读] Image Harmonization by Matching Regional References

Ziyue Zhu, Zhao Zhang|arXiv (Cornell University)|Apr 10, 2022
Image Enhancement Techniques被引用 7
一句话总结

本文提出了一种新颖的图像和谐化方法,通过匹配与内容相关的背景区域而非应用全局外观迁移,自适应地调整前景外观。通过利用深层与浅层特征进行从粗到精的外观转换,并采用残差重建策略以保留细节,该方法在iHarmony4数据集上实现了SOTA性能,PSNR达到38.57 dB,MSE为21.43,尽管参数量更少,但仍优于先前方法。

ABSTRACT

To achieve visual consistency in composite images, recent image harmonization methods typically summarize the appearance pattern of global background and apply it to the global foreground without location discrepancy. However, for a real image, the appearances (illumination, color temperature, saturation, hue, texture, etc) of different regions can vary significantly. So previous methods, which transfer the appearance globally, are not optimal. Trying to solve this issue, we firstly match the contents between the foreground and background and then adaptively adjust every foreground location according to the appearance of its content-related background regions. Further, we design a residual reconstruction strategy, that uses the predicted residual to adjust the appearance, and the composite foreground to reserve the image details. Extensive experiments demonstrate the effectiveness of our method. The source code will be available publicly.

研究动机与目标

  • 为解决现有图像和谐化方法中全局外观迁移的局限性,该方法未能充分考虑真实图像中区域外观的差异。
  • 通过基于每个前景位置最相关的背景区域进行自适应调整,提升视觉一致性。
  • 在仅调整光照与色调等外观属性的同时,保留原始合成前景的细粒度细节。
  • 与现有方法相比,以更低的模型复杂度实现更优的性能表现。

提出的方法

  • 在深度神经网络的特征空间中,利用内容相似性匹配前景与背景表征,以识别每个前景位置最相关的背景区域。
  • 采用两种外观转换策略:使用深层、低分辨率特征进行粗粒度结构建模,以及使用浅层、高分辨率特征结合基于块的统计量进行细粒度细节建模。
  • 将背景区域划分为重叠的块,每个块的外观通过其通道维度的均值与标准差表示。
  • 基于内容相似性进行加权融合以实现外观迁移,确保每个前景像素仅使用其最相关的背景参考进行调整。
  • 通过学习并应用残差调整,采用残差重建策略保留原始前景细节,避免端到端生成过程。
  • 该方法在U-Net架构的生成器中实现,仅引入极少额外参数,从而在计算成本较低的前提下实现高性能。

实验结果

研究问题

  • RQ1通过匹配与内容相关的背景区域,是否能超越全局外观迁移,在图像和谐化中实现更优效果?
  • RQ2与基于自注意力或全局统计量的方法相比,区域参考匹配在性能与效率方面表现如何?
  • RQ3基于残差的重建策略是否能在调整光照与色调等外观属性的同时,有效保留前景细节?
  • RQ4从粗到精的外观转换策略在提升合成图像视觉一致性方面有多大的增强作用?
  • RQ5在采用内容感知的区域匹配方法时,是否仍能实现减少模型参数量的同时提升性能?

主要发现

  • 所提方法在iHarmony4基准测试中取得38.57 dB PSNR、21.43 MSE与248.12 fMSE,优于所有对比方法。
  • 仅使用117.42M参数,该方法比第二好的方法高出0.42 dB PSNR,展现出卓越的参数效率。
  • 将全局AdaIN模块替换为所提出的块到位置转换(PTL)后,PSNR提升0.33 dB,MSE降低1.08,fMSE降低17.69,充分证明了内容感知区域匹配的有效性。
  • 将通道宽度从C提升至4C后,PSNR提升0.60 dB,MSE降低3.73,fMSE降低34.57,表明方法具有强大可扩展性且性能下降极小。
  • 在性能与计算效率方面,该方法优于自注意力及其他注意力机制,尤其在高分辨率特征上表现更优。
  • 消融实验证实,粗到精策略与残差重建机制对实现高质量和谐化均不可或缺。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。