Skip to main content
QUICK REVIEW

[论文解读] S3Net: A Single Stream Structure for Depth Guided Image Relighting

Hao-Hsiang Yang, Wei‐Ting Chen|arXiv (Cornell University)|May 3, 2021
Advanced Vision and Imaging参考文献 36被引用 4
一句话总结

S3Net 是一种用于深度引导的任意到任意图像重新光照的单流深度学习框架,通过将源图像和引导图像及其深度图作为输入,利用增强注意力和残差模块的编码器-解码器架构生成重新光照图像。该方法在 NTIRE 2021 挑战赛中以 0.6969 的 SSIM 得分位列第三,采用基于小波的 SSIM 损失以提升感知质量。

ABSTRACT

Depth guided any-to-any image relighting aims to generate a relit image from the original image and corresponding depth maps to match the illumination setting of the given guided image and its depth map. To the best of our knowledge, this task is a new challenge that has not been addressed in the previous literature. To address this issue, we propose a deep learning-based neural Single Stream Structure network called S3Net for depth guided image relighting. This network is an encoder-decoder model. We concatenate all images and corresponding depth maps as the input and feed them into the model. The decoder part contains the attention module and the enhanced module to focus on the relighting-related regions in the guided images. Experiments performed on challenging benchmark show that the proposed model achieves the 3 rd highest SSIM in the NTIRE 2021 Depth Guided Any-to-any Relighting Challenge.

研究动机与目标

  • 为解决深度引导的任意到任意图像重新光照这一新挑战,即利用深度图将源图像重新光照以匹配引导图像的光照条件。
  • 设计一种高效的单流架构,避免双流网络带来的计算负担,同时有效融合 RGB 与深度特征。
  • 通过在解码器中引入注意力机制和增强的特征精炼模块,提升方向性光照与阴影转移的重新光照质量。
  • 通过基于离散小波变换的多尺度损失函数优化训练,以增强全局与局部图像保真度。
  • 在 NTIRE 2021 深度引导任意到任意重新光照挑战赛中实现最先进性能。

提出的方法

  • 该模型采用单流编码器-解码器架构,将源图像与引导图像及其对应的深度图拼接为单个 6 通道输入张量。
  • 编码器使用 Res2Net 模块提取具有多尺度感受野扩展的层次化特征。
  • 解码器集成注意力模块以突出重新光照相关区域,并引入增强模块以优化特征图,提升阴影与光照一致性的表现。
  • 训练过程中使用基于小波的 SSIM 损失(L_{W-SSIM}),通过捕捉多尺度结构细节以提升感知质量。
  • 损失函数结合 L_{Cha}、L_{SSIM} 和 L_{Per} 以保证颜色、结构与感知保真度,最佳设置中用 L_{W-SSIM} 替代 L_{SSIM}。
  • 网络在 VIDIT 数据集上端到端训练,每张 1024×1024 图像的推理时间为 2.042 秒。

实验结果

研究问题

  • RQ1单流网络能否在避免双流复杂性的情况下,有效融合 RGB 与深度特征,实现任意到任意的图像重新光照?
  • RQ2注意力机制与增强模块的集成在阴影与光照转移中如何提升重新光照质量?
  • RQ3与标准 SSIM 相比,使用小波 SSIM 损失在重新光照任务中能在多大程度上提升感知质量?
  • RQ4仅使用深度图作为空间引导,该模型能否在包括色温与方向光照在内的多种光照条件下实现良好泛化?
  • RQ5与现有方法相比,该方法在 NTIRE 2021 基准测试中的表现如何?

主要发现

  • 所提出的 S3Net 在 NTIRE 2021 深度引导任意到任意重新光照挑战赛中,SSIM 与 MPS 指标位列第三,验证集 SSIM 为 0.7022,测试集 SSIM 为 0.6784。
  • 在测试集上,PSNR 达到 19.2212,LPIPS 为 0.1566,表明其具有出色的感知与结构保真度。
  • 消融实验表明,使用深度图(设置 2)相比仅使用图像(设置 1)将 SSIM 从 0.6821 提升至 0.6913。
  • 将标准 SSIM 替换为小波 SSIM(设置 3)后,SSIM 进一步提升至 0.6969,PSNR 达到 19.1281,证实了多尺度损失的有效性。
  • 视觉对比结果表明,小波 SSIM 损失生成的重新光照图像更接近真实值,阴影去除与光照转移效果更优。
  • 当图像存在大范围模糊阴影时,模型表现不佳,原因在于深度图信息有限,表明未来工作需增强三维推理能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。