[论文解读] High-Resolution Photorealistic Image Translation in Real-Time: A Laplacian Pyramid Translation Network
本文提出拉普拉斯金字塔转换网络(LPTN),一种实时、高分辨率的逼真图像到图像转换方法,通过将图像分解为拉普拉斯金字塔,将低频属性(如光照、色彩)与高频细节分离。通过使用轻量级网络对低分辨率低频分量进行转换,并采用渐进式掩码策略细化高频分量,LPTN 在单张 GPU 上实现了 4K 图像的实时推理,同时在逼真度和风格迁移方面达到或超越当前最先进水平。
Existing image-to-image translation (I2IT) methods are either constrained to low-resolution images or long inference time due to their heavy computational burden on the convolution of high-resolution feature maps. In this paper, we focus on speeding-up the high-resolution photorealistic I2IT tasks based on closed-form Laplacian pyramid decomposition and reconstruction. Specifically, we reveal that the attribute transformations, such as illumination and color manipulation, relate more to the low-frequency component, while the content details can be adaptively refined on high-frequency components. We consequently propose a Laplacian Pyramid Translation Network (LPTN) to simultaneously perform these two tasks, where we design a lightweight network for translating the low-frequency component with reduced resolution and a progressive masking strategy to efficiently refine the high-frequency ones. Our model avoids most of the heavy computation consumed by processing high-resolution feature maps and faithfully preserves the image details. Extensive experimental results on various tasks demonstrate that the proposed method can translate 4K images in real-time using one normal GPU while achieving comparable transformation performance against existing methods. Datasets and codes are available: https://github.com/csjliang/LPTN.
研究动机与目标
- 解决现有逼真图像到图像转换(I2IT)方法在高分辨率图像上因在高分辨率特征图上执行大量卷积操作而导致的效率低下问题。
- 克服基于自编码器和生成对抗网络(GAN)的现有 I2IT 模型在深层编码-解码结构中因处理高分辨率特征而产生的计算瓶颈。
- 在保持精细内容细节的同时,实现在 4K 图像上的实时推理,并实现逼真的风格迁移。
- 通过利用拉普拉斯金字塔的频率带结构,将领域特定属性(如光照、色彩)与内容细节解耦。
- 开发一种轻量级、端到端可训练的框架,保持重建保真度,并支持无监督、对抗性训练。
提出的方法
- 应用闭式拉普拉斯金字塔分解,将高分辨率输入图像分解为多尺度频率带:一个低频分量和多个分辨率递减的高频分量。
- 使用轻量级残差网络对低分辨率下的低频分量进行转换,以最小化计算成本,同时保留光照、色彩等全局属性。
- 设计一种渐进式掩码策略,先在最小的高频分量上学习掩码,再通过双线性插值和两层卷积层上采样,以细化更高频分量。
- 使用对抗性损失对整个网络进行端到端无监督训练,以确保图像的逼真度和内容一致性。
- 通过逆拉普拉斯金字塔重建,将转换后的低频分量与细化后的高频分量组合,生成最终输出。
- 利用高频分量之间的空间相关性以减少计算量——仅通过小型网络预测最小高频掩码,避免在全分辨率上进行卷积操作。
实验结果
研究问题
- RQ1拉普拉斯金字塔分解是否能通过将属性操作与细节细化分离,实现高效、高分辨率的逼真图像转换?
- RQ2通过渐进式掩码策略对低频分量进行转换并自适应地细化高频分量,是否能在不损失图像质量的前提下降低计算成本?
- RQ3所提方法是否能在 4K 图像上实现实时推理,同时在性能上与当前最先进 I2IT 模型保持竞争力?
- RQ4将领域特定属性(如一天中的时间、季节)与内容细节解耦,对转换保真度和逼真度有何影响?
- RQ5与标准 GAN 或自编码器基 I2IT 方法相比,渐进式掩码策略在保留细粒度纹理和减少伪影方面表现如何?
主要发现
- LPTN 在单张桌面 GPU 上实现了 4K 图像的实时推理,当 L=4 时,与 CycleGAN 在 1080p 图像上的推理速度相比,速度提升约 ×80。
- 当使用 L=5 级拉普拉斯金字塔分解时,模型在 4K 分辨率图像上仍能实现实时推理。
- 用户研究表明,在白天到夜晚的图像转换中,LPTN 在逼真度上的偏好得分为 78.3%,在美学质量上的偏好得分为 57.5%,显著优于 CycleGAN(分别为 16.4% 和 21.3%)及其他基线模型。
- 定量结果表明,白天与夜晚图像的高频分量之间的均方误差(MSE)约为低频分量的 1/71 和 1/65,表明属性变化主要由低频内容主导。
- LPTN 保持了高重建保真度,避免了如 CycleGAN 和 UNIT 等方法在大范围均匀区域中常见的结构失真和伪影。
- 渐进式掩码策略仅通过两层卷积和双线性上采样即可高效细化高频分量,避免在高分辨率特征图上执行重型卷积操作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。