[论文解读] Leveraging Multi-view Image Sets for Unsupervised Intrinsic Image Decomposition and Highlight Separation
本文提出了一种无监督深度学习方法,用于利用多视角真实图像(如客户产品照片)进行固有图像分解与高光分离。该方法引入了一种基于颜色分布的图像表征,降低了对错位的敏感性,并提出了一种对比损失,通过利用高光与阴影之间的相互依赖关系,提升了高光与阴影的分离效果,在无需真实标签的情况下,在两项任务上均达到了最先进性能。
We present an unsupervised approach for factorizing object appearance into highlight, shading, and albedo layers, trained by multi-view real images. To do so, we construct a multi-view dataset by collecting numerous customer product photos online, which exhibit large illumination variations that make them suitable for training of reflectance separation and can facilitate object-level decomposition. The main contribution of our approach is a proposed image representation based on local color distributions that allows training to be insensitive to the local misalignments of multi-view images. In addition, we present a new guidance cue for unsupervised training that exploits synergy between highlight separation and intrinsic image decomposition. Over a broad range of objects, our technique is shown to yield state-of-the-art results for both of these tasks.
研究动机与目标
- 开发一种无监督方法,利用真实世界中的多视角图像集将物体图像分解为反照率、阴影和高光层。
- 解决来自客户产品照片等来源的多视角图像存在错位问题的训练挑战,此类图像虽常见但难以精确对齐。
- 通过建模高光分离与阴影估计之间的相互依赖关系,提升固有图像分解的可靠性。
- 在无需真实标签的情况下,于高光分离与固有图像分解两项任务上均实现最先进性能。
提出的方法
- 该方法使用具有大光照变化的客户产品照片多视角数据集,以无监督方式训练网络。
- 提出一种基于局部颜色分布的新图像表征,舍弃精细的位置信息,使训练对局部错位具有鲁棒性。
- 提出颜色分布损失,通过比较局部颜色直方图在多视角图像间强制一致性,降低对错位的敏感性。
- 在无高光子网络与有高光子网络计算出的阴影估计之间引入对比损失,引导网络生成更准确的高光与阴影分量。
- 通过结合无监督损失进行端到端训练,并在小部分合成ShapeNet数据上预训练后,使用真实数据进行微调。
- 网络架构通过图像形成模型 $I_d = A \cdot S$ 联合优化高光、阴影和反照率层。
实验结果
研究问题
- RQ1能否有效利用来自客户产品照片等非结构化来源的多视角真实图像来训练无监督的固有图像分解与高光分离?
- RQ2如何使多视角图像集的训练对常见于真实数据中的局部错位具有鲁棒性?
- RQ3能否利用高光分离与固有分解之间的关系,同时提升两项任务的性能?
- RQ4在存在错位的情况下,基于颜色分布的表征相比标准像素级损失,性能提升如何?
- RQ5利用高光与阴影估计依赖关系的对比损失,能否提升整体分解质量?
主要发现
- 在DiLiGenT数据集上,所提方法实现了最低的阴影MSE(0.0041)和DSSIM(0.0316),优于SIRFS、DI、Shi等人、Li等人和CG方法。
- 在ShapeNet固有图像数据集上,该方法在固有分解的MSE和DSSIM上均达到最先进性能,无监督微调与颜色分布损失带来了显著改进。
- 消融研究显示,若移除对比损失,将导致退化解,其中漫反射层全为零,证实其在网络稳定性中的关键作用。
- 颜色分布损失使性能相比像素级低秩损失提升了5%至48%,尤其在阴影估计方面表现更优,能更好捕捉表面形状。
- 尽管仅在1.1%的ShapeNet数据集上进行微调,该方法在合成图像上仍表现出良好泛化能力,并优于在更大合成数据集上训练的方法。
- 真实图像上的定性结果表明,端到端系统生成的反照率图更清晰,纹理细节更丰富,优于先前方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。