[论文解读] High-Resolution Image Harmonization via Collaborative Dual Transformations
该论文提出CDTNet,一种新颖的端到端深度学习框架,用于高分辨率图像合成,通过协同双重学习统一像素到像素的转换与RGB到RGB的转换。通过结合低分辨率U-Net生成器、基于基底查表(LUT)的可学习颜色映射模块及权重预测器,以及轻量级优化模块,CDTNet在高达2048×2048的高分辨率图像上实现了最先进性能,同时显著降低了计算成本和内存占用。
Given a composite image, image harmonization aims to adjust the foreground to make it compatible with the background. High-resolution image harmonization is in high demand, but still remains unexplored. Conventional image harmonization methods learn global RGB-to-RGB transformation which could effortlessly scale to high resolution, but ignore diverse local context. Recent deep learning methods learn the dense pixel-to-pixel transformation which could generate harmonious outputs, but are highly constrained in low resolution. In this work, we propose a high-resolution image harmonization network with Collaborative Dual Transformation (CDTNet) to combine pixel-to-pixel transformation and RGB-to-RGB transformation coherently in an end-to-end network. Our CDTNet consists of a low-resolution generator for pixel-to-pixel transformation, a color mapping module for RGB-to-RGB transformation, and a refinement module to take advantage of both. Extensive experiments on high-resolution benchmark dataset and our created high-resolution real composite images demonstrate that our CDTNet strikes a good balance between efficiency and effectiveness. Our used datasets can be found in https://github.com/bcmi/CDTNet-High-Resolution-Image-Harmonization.
研究动机与目标
- 为解决深度学习中高分辨率图像合成方法的不足,特别是针对真实世界合成图像的应用。
- 克服现有方法的局限性:像素到像素网络产生的低分辨率输出,以及RGB到RGB转换导致的全局色调不匹配。
- 在端到端框架中统一像素级与全局色彩转换,同时保留局部细节与全局一致性。
- 在保持高分辨率图像高质量合成的同时,降低计算与内存开销。
- 在新构建的高分辨率真实合成图像数据集上评估性能。
提出的方法
- CDTNet采用低分辨率U-Net生成器,在下采样输入上执行密集的像素到像素转换,以保留精细的局部细节。
- 颜色映射模块利用共享的基底LUT和从U-Net编码器特征提取的可学习权重预测器,学习图像特定的RGB到RGB转换。
- 权重预测器生成基底LUT的组合系数,实现在不重新训练的前提下对高分辨率输入进行全局色彩调整。
- 轻量级优化模块通过混合层融合低分辨率像素级输出、高分辨率RGB到RGB结果、前景掩码以及上采样的解码器特征。
- 优化模块使用拼接与残差学习,增强局部细节,同时保留颜色映射模块提供的全局色调。
- 整个网络端到端训练,低分辨率生成器与颜色映射模块联合优化,以提升合成质量。
实验结果
研究问题
- RQ1基于深度学习的RGB到RGB转换能否在高分辨率图像合成中被有效学习并应用?
- RQ2如何协同结合像素级与全局色彩转换,以同时提升高分辨率合成中的局部细节与全局一致性?
- RQ3在高分辨率设置下,何种架构能最优平衡计算效率与合成质量?
- RQ4轻量级优化模块能否在不增加内存或FLOP开销的前提下,有效利用高分辨率引导增强低分辨率输出?
- RQ5所提方法在真实世界高分辨率合成图像上与现有最先进方法相比表现如何?
主要发现
- 在1024×1024分辨率的HAdobe5k基准上,CDTNet实现了最先进性能,PSNR达38.77,SSIM达152.13,优于先前方法。
- 消融实验表明,移除任一组件(尤其是优化模块的混合层)均会显著降低性能,证明其必要性。
- 与先前最先进方法相比,CDTNet将2048×2048图像合成的FLOPs降至200G以下,内存占用控制在20GB以下,而此前方法需超过950G FLOPs和20GB内存。
- 使用共享基底LUT与可学习权重预测器的方案优于独立编码器或全局池化方法,表明联合特征学习的优势。
- 在100张真实高分辨率合成图像上的用户研究显示,CDTNet生成的结果在视觉上比pix2pixHD和iS2AM更自然可信。
- 通过将像素到像素学习限制在低分辨率,并使用轻量级优化模块,该方法保持了高效率,支持实际部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。