[论文解读] MSR-Net: Multi-Scale Relighting Network for One-to-One Relighting
该论文提出 MSR-Net,一种轻量级、可微分的堆叠多尺度深度网络,用于一对一图像重光照,通过在三个图像尺度上进行自粗至精的层次特征聚合。该方法采用两阶段训练策略与加权组合损失函数,在 VIDIT 数据集上实现了 SOTA 性能,PSNR 达 17.89,SSIM 达 0.5899,显著减少了伪影并提升了感知质量,优于先前模型。
Deep image relighting allows photo enhancement by illumination-specific retouching without human effort and so it is getting much interest lately. Most of the existing popular methods available for relighting are run-time intensive and memory inefficient. Keeping these issues in mind, we propose the use of Stacked Deep Multi-Scale Hierarchical Network, which aggregates features from each image at different scales. Our solution is differentiable and robust for translating image illumination setting from input image to target image. Additionally, we have also shown that using a multi-step training approach to this problem with two different loss functions can significantly boost performance and can achieve a high quality reconstruction of a relighted image.
研究动机与目标
- 为解决现有重光照方法计算成本高、内存效率低的问题,设计更高效且可微分的网络架构。
- 通过基于编码器-解码器结构、跨尺度跳跃连接的自粗至精多尺度特征层次结构,提升图像重光照性能。
- 通过引入新颖的两阶段训练策略与多损失函数加权组合,提升重建质量与边缘保持能力。
- 在保持高质量重光照结果的同时,实现高推理速度与低内存占用,尤其适用于色彩温度与光照方向迁移任务。
- 在艺术增强、数据增强与域适应等重光照任务中,展示出良好的鲁棒性与泛化能力。
提出的方法
- 核心架构为堆叠深度多尺度分层网络(Stacked DMSHN),通过将基础深度多尺度分层网络(DMSHN)级联两次,提升特征表示能力与性能表现。
- 网络通过三级图像金字塔处理输入图像,每一级包含一个编码器与一个解码器;跳跃连接将低层级特征传递至高层级,以保留空间与上下文细节。
- 每一级的编码器输出在传递至下一级解码器前,与前一级的输出进行拼接,实现层次化特征融合与更优的全局上下文建模。
- 模型采用两阶段训练:第一阶段使用 L2 损失进行初始收敛,第二阶段使用结合 L1、SSIM、感知损失与总变差损失的组合损失函数。
- 组合损失函数定义为 $ L_{CL} = \lambda_1 L_1 + \lambda_2 L_{SSIM} + \lambda_3 L_p + \lambda_4 L_{tv} $,其中超参数 $ \lambda_1=1 $,$ \lambda_2=-5e^{-3} $,$ \lambda_3=0.006 $,$ \lambda_4=2e^{-8} $。
- 训练使用 Adam 优化器,学习率从 2e-3 递减至 5e-5,共 2500 个周期,批量大小为 2,输入图像统一缩放为 512×512 以提升效率。
实验结果
研究问题
- RQ1堆叠式多尺度深度网络是否能在推理时间与内存占用更低的前提下,实现优于现有模型的重光照性能?
- RQ2采用组合损失函数的两阶段训练策略是否能提升重光照图像的感知质量并减少伪影?
- RQ3L1、SSIM、感知损失与总变差损失等多组件损失的整合,如何影响重建保真度与边缘保持能力?
- RQ4可微分的端到端架构在图像重光照任务中,是否能显著优于非可微分的两阶段方法?
- RQ5该模型在无需深度或几何先验的前提下,能否在色彩温度与光照方向迁移任务中实现良好泛化?
主要发现
- Stacked DMSHN 模型在验证集上实现了 17.89 的 PSNR 与 0.5899 的 SSIM,优于所有对比模型,包括 DRN、Dense-GridNet 与 SRN。
- 所提出的组合损失函数 ($ L_{CL} $) 显著提升了 PSNR 与 LPIPS 分数,相比仅使用 L2 损失或组合 Sobel 损失,实现 17.89 的 PSNR 与 0.4088 的 LPIPS 分数。
- 该模型在可比多尺度模型中实现了最低的平均推理时间(0.0116 秒),为对比中最快。
- 定性结果表明,尽管 Dense-GridNet 的 LPIPS 分数更低,Stacked DMSHN 生成的图像伪影更少,感知质量更优。
- 两阶段训练过程显著提升了性能,最终模型在所有指标上均优于单阶段训练。
- 模型在光照梯度生成方面表现中等,但在遮挡暗区区域表现较差,原因在于缺乏深度信息,提示未来工作需引入多视角输入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。