Skip to main content
QUICK REVIEW

[论文解读] StyleGAN knows Normal, Depth, Albedo, and More

Anand Bhattad, Daniel McKee|arXiv (Cornell University)|Jun 1, 2023
Computer Graphics and Visualization Techniques被引用 6
一句话总结

该论文表明,StyleGAN 在其潜在空间中固有地编码了图像的内在属性表示——如法线、深度、反照率和语义分割——而无需对这些数据进行显式训练。通过向噪声向量施加固定的、任务特定的潜在偏移,模型生成了对光照变化具有鲁棒性的高质量内在图像,其表现优于当前最先进的回归方法。

ABSTRACT

Intrinsic images, in the original sense, are image-like maps of scene properties like depth, normal, albedo or shading. This paper demonstrates that StyleGAN can easily be induced to produce intrinsic images. The procedure is straightforward. We show that, if StyleGAN produces $G({w})$ from latents ${w}$, then for each type of intrinsic image, there is a fixed offset ${d}_c$ so that $G({w}+{d}_c)$ is that type of intrinsic image for $G({w})$. Here ${d}_c$ is {\em independent of ${w}$}. The StyleGAN we used was pretrained by others, so this property is not some accident of our training regime. We show that there are image transformations StyleGAN will {\em not} produce in this fashion, so StyleGAN is not a generic image regression engine. It is conceptually exciting that an image generator should ``know'' and represent intrinsic images. There may also be practical advantages to using a generative model to produce intrinsic images. The intrinsic images obtained from StyleGAN compare well both qualitatively and quantitatively with those obtained by using SOTA image regression techniques; but StyleGAN's intrinsic images are robust to relighting effects, unlike SOTA methods.

研究动机与目标

  • 探究预训练的生成模型(如 StyleGAN)是否隐式编码了诸如深度、法线、反照率和语义分割等内在场景属性。
  • 确定这些内在表示是否可通过仅操作潜在空间而无需微调或重新训练即可访问。
  • 评估这些内在图像的质量与鲁棒性,与当前最先进的基于回归的方法进行比较。
  • 检验 StyleGAN 是通用图像处理器,还是专门编码了场景的几何与光度属性。

提出的方法

  • 对预训练的 StyleGAN 的输入潜在向量 $\mathbf{w}$ 施加固定的、任务特定的潜在码偏移 $\mathbf{d}_c$,以生成内在图像:$G(\mathbf{w} + \mathbf{d}_c)$。
  • 使用加权回归损失来学习每种内在类型(如法线、深度、反照率、语义分割)的偏移 $\mathbf{d}_c$,以最小化生成图像与目标内在图之间的差异。
  • 利用未接触过内在图像数据的预训练 StyleGAN,确保所学表示并非训练过程中的偶然产物。
  • 使用 StyLitGAN 生成同一场景的光照增强版本,以评估在重新光照条件下的内在表示鲁棒性。
  • 通过定量指标(如平均交并比、角度误差)和定性对比,将生成的内在图像与最先进回归模型进行比较。
  • 通过尝试仅通过潜在偏移实现图像左右半部分互换的控制实验,结果失败——表明 StyleGAN 并非执行通用图像变换。

实验结果

研究问题

  • RQ1预训练的 StyleGAN 模型是否可在无需任何微调或额外学习的情况下,生成内在图像(如法线、深度、反照率)?
  • RQ2StyleGAN 潜在空间中的内在图像表示是否独立于输入潜在码 $\mathbf{w}$?即,固定的偏移 $\mathbf{d}_c$ 是否能在所有 $\mathbf{w}$ 上可靠生成期望的内在图像?
  • RQ3与当前最先进的基于回归的方法相比,StyleGAN 生成的内在图像在质量和鲁棒性方面如何,尤其是在光照变化条件下?
  • RQ4StyleGAN 是通用图像处理器,还是专门编码了场景的几何与光度属性?
  • RQ5在当前 GAN 反演技术的限制下,能否利用生成模型的潜在空间从真实图像中提取内在图像?

主要发现

  • StyleGAN 仅通过固定的、任务特定的潜在偏移 $\mathbf{d}_c$ 即可生成高质量的内在图像(法线、深度、反照率、语义分割),无需任何微调或重新训练。
  • StyleGAN 生成的内在图像对光照变化具有鲁棒性,其法线的平均角度误差在 16 种光照条件下保持稳定,而最先进回归模型的平均偏差达 8 度(最高达 14 度)。
  • 定量比较显示,StyleGAN 生成的语义分割在 ADE20k 基准上表现与大型视觉 Transformer(DPT)相当,定性结果表明其对罕见物体(如灯、靠垫)的完整性更优。
  • 控制实验表明,StyleGAN 无法执行通用图像操作(如左右图像互换),支持其编码的是内在场景属性而非通用图像处理器的结论。
  • 尽管模型更小且未使用数据增强或 3D 监督,该方法在对光照变化的鲁棒性方面仍优于最先进回归模型。
  • 结果表明,内在图像表示并非偶然产物,而可能源于模型合成逼真图像的需求,暗示此类表示是图像生成的根本组成部分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。