[论文解读] Unsupervised Learning for Intrinsic Image Decomposition from a Single Image
本文提出了一种新颖的无监督单图像固有图像分解框架,通过从成对的、无关联的自然图像中学习反射率与阴影,而无需依赖标注数据或手工设计的先验。通过强制实施物理一致性、域不变内容以及反射率-阴影独立性,该方法在多个基准测试中达到最先进性能,优于现有无监督方法,并与有监督方法相当。
Intrinsic image decomposition, which is an essential task in computer vision, aims to infer the reflectance and shading of the scene. It is challenging since it needs to separate one image into two components. To tackle this, conventional methods introduce various priors to constrain the solution, yet with limited performance. Meanwhile, the problem is typically solved by supervised learning methods, which is actually not an ideal solution since obtaining ground truth reflectance and shading for massive general natural scenes is challenging and even impossible. In this paper, we propose a novel unsupervised intrinsic image decomposition framework, which relies on neither labeled training data nor hand-crafted priors. Instead, it directly learns the latent feature of reflectance and shading from unsupervised and uncorrelated data. To enable this, we explore the independence between reflectance and shading, the domain invariant content constraint and the physical constraint. Extensive experiments on both synthetic and real image datasets demonstrate consistently superior performance of the proposed method.
研究动机与目标
- 解决在自然图像中进行固有图像分解的挑战,而无需昂贵或不切实际的反射率与阴影标注。
- 克服依赖于合成或人工标注数据集的有监督方法的局限性,这些数据集在真实世界中的泛化能力有限。
- 开发一种完全无监督的框架,利用未配对的、无关联的自然图像集合学习固有成分而无需监督。
- 引入并强制实施三项关键物理约束——物理一致性、域不变内容和反射率-阴影独立性,以指导无监督学习。
提出的方法
- 将固有图像分解表述为内容保持的图像翻译任务,将自然图像转换到反射率和阴影域,同时保持底层内容。
- 使用共享编码器和解码器分支的条件生成对抗网络(cGAN),以学习反射率和阴影的解耦表示。
- 通过约束 $ I = R(I) \bigodot S(I) $ 强制实施物理一致性,确保预测的反射率与阴影的乘积重建输入图像。
- 应用域不变内容约束,确保自然图像、反射率和阴影域之间底层物体布局、几何结构和组织保持不变。
- 通过在潜在空间中建模反射率对光照不变、阴影对光照可变,强制实施反射率-阴影独立性,利用统计独立性。
- 集成反射率平滑度损失 $ \\_R^{smooth} $ 以促进分段常数反射率,使用空间和色度特征及学习到的协方差矩阵。
实验结果
研究问题
- RQ1是否可以在完全无监督的情况下,无需任何标注的反射率或阴影数据,有效学习固有图像分解?
- RQ2如何在无监督深度学习框架中嵌入如反射率-阴影独立性和物理一致性等物理先验?
- RQ3单图像无监督方法是否能在真实世界基准上实现与有监督方法相当或更优的性能?
- RQ4来自自然场景的未配对、无关联图像集合在在多大程度上可作为学习固有图像成分的代理?
主要发现
- 在 MIT 固有图像数据集上,该方法在反射率与阴影平均值的均方误差(MSE)为 0.0146 的情况下,达到无监督方法中的最佳性能。
- 在 IIW 基准上,该方法的 WHDR 为 18.69%,优于所有其他无监督方法,并接近有监督最先进方法的性能。
- 在定性比较中,该方法在保留物体边界和纹理细节方面,生成的反射率和阴影图比 MUNIT、LS18 和 WH18 更清晰、更准确。
- 消融研究证实,物理一致性、域不变内容和反射率-阴影独立性这三项约束对性能至关重要,若省略任一约束将导致性能显著下降。
- 该方法在真实世界场景中泛化良好,这从其在 IIW 和 MIT 数据集上表现出色的结果中得到验证,尽管训练过程中未接触真实标签。
- 反射率平滑度损失显著提升了感知质量,并减少了反射率图中的噪声,尤其是在渐变光照区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。