[论文解读] Revisiting Deep Intrinsic Image Decompositions
本文提出了一种统一的深度学习架构用于固有图像分解,在 MIT、MPI-Sintel 和 IIW 多个基准测试中实现了最先进性能,通过结合共享主干网络与灵活的数据集特定监督层实现。该方法利用可微分的端到端可训练流程,引入边缘引导网络与一维递归域滤波器以强制实现分段常数的反照率,从而实现无需后处理的快速、高质量分解。
While invaluable for many computer vision applications, decomposing a natural image into intrinsic reflectance and shading layers represents a challenging, underdetermined inverse problem. As opposed to strict reliance on conventional optimization or filtering solutions with strong prior assumptions, deep learning based approaches have also been proposed to compute intrinsic image decompositions when granted access to sufficient labeled training data. The downside is that current data sources are quite limited, and broadly speaking fall into one of two categories: either dense fully-labeled images in synthetic/narrow settings, or weakly-labeled data from relatively diverse natural scenes. In contrast to many previous learning-based approaches, which are often tailored to the structure of a particular dataset (and may not work well on others), we adopt core network structures that universally reflect loose prior knowledge regarding the intrinsic image formation process and can be largely shared across datasets. We then apply flexibly supervised loss layers that are customized for each source of ground truth labels. The resulting deep architecture achieves state-of-the-art results on all of the major intrinsic image benchmarks, and runs considerably faster than most at test time.
研究动机与目标
- 解决固有图像分解作为病态逆问题的挑战,需要强先验知识。
- 克服现有数据集特定深度学习架构在多样化数据源间缺乏泛化能力的局限。
- 开发一种准通用的网络架构,在不同数据集间保持一致的结构,同时适应不同的监督形式(密集标签与成对比较)。
- 将通用先验(如分段常数反照率与平滑阴影)整合到网络设计中,以提升泛化能力。
- 实现端到端训练,最大限度减少后处理,并在多样化的真实世界与合成数据上实现高推理速度。
提出的方法
- 设计一个反映固有图像形成通用先验(分段常数反照率与平滑阴影)的核心深度网络架构。
- 引入一个引导网络,主要从反照率层预测显著边缘,以指导后续优化。
- 应用一维递归域滤波器,利用引导网络的输出引导反照率预测趋向分段常数解。
- 采用灵活的数据集特定损失层:对密集真实值使用均方误差(MSE)(MIT、MPI-Sintel),对稀疏成对比较使用改进的铰链损失(IIW)。
- 在所有数据集上共享主干网络与引导网络参数,实现端到端联合训练。
- 通过将 IIW 损失的尺度设为 MPI-Sintel MSE 损失的两倍,实现异构监督下梯度的平衡。
实验结果
研究问题
- RQ1单一深度网络架构是否能在具有不同监督形式的多个固有图像基准上实现最先进性能?
- RQ2在不进行数据集特定调优的前提下,通用先验(如分段常数反照率)在多大程度上可嵌入深度网络以提升泛化能力?
- RQ3在同时使用密集标签(MPI-Sintel)与弱标签(IIW)数据进行联合训练时,是否能提升在未见真实世界图像上的性能?
- RQ4当训练数据有限时,统一架构是否能超越在单个数据集上训练的专用模型?
- RQ5一维递归域滤波器在保持细节与锐利边缘的同时,强制实现分段常数反照率的效率如何?
主要发现
- 所提方法在 MIT 固有图像数据集上实现了最低的 MSE(0.0134)与 LMSE(0.0111),优于先前所有深度学习方法,包括使用额外训练数据的方法。
- 在 MPI-Sintel 基准上,该模型在所有评估指标上均达到最先进水平,输出结果更清晰、质量更高。
- 在 IIW 与 MPI-Sintel 数据上联合训练后,模型在 IIW 上实现了 15.80 的平均 WHDR,优于大多数先前方法,表明在真实世界场景中具有更强鲁棒性。
- 定性结果表明,联合训练显著提升了未见户外场景中反照率估计的逼真度与平滑性。
- 该模型在推理阶段显著快于大多数现有方法,实现了无需后处理的高效推理。
- 模块化且灵活的监督设计使得同一核心架构可仅通过最小的架构修改,有效适配多种数据源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。