Skip to main content
QUICK REVIEW

[论文解读] Learning to Generate Synthetic 3D Training Data through Hybrid Gradient

Dawei Yang, Jia Deng|arXiv (Cornell University)|Jun 29, 2019
3D Shape Modeling and Analysis参考文献 62被引用 4
一句话总结

本文提出一种混合梯度方法,用于自动优化合成3D训练数据生成,以提升单张图像3D感知任务的泛化性能。通过结合有限差分的近似梯度与通过展开训练过程的反向传播获得的解析梯度,该方法高效优化了以连续向量表示的设计参数(例如3D形状、纹理),在深度估计和固有图像分解基准上实现了显著降低的计算成本下的最先进性能。

ABSTRACT

Synthetic images rendered by graphics engines are a promising source for training deep networks. However, it is challenging to ensure that they can help train a network to perform well on real images, because a graphics-based generation pipeline requires numerous design decisions such as the selection of 3D shapes and the placement of the camera. In this work, we propose a new method that optimizes the generation of 3D training data based on what we call "hybrid gradient". We parametrize the design decisions as a real vector, and combine the approximate gradient and the analytical gradient to obtain the hybrid gradient of the network performance with respect to this vector. We evaluate our approach on the task of estimating surface normal, depth or intrinsic decomposition from a single image. Experiments on standard benchmarks show that our approach can outperform the prior state of the art on optimizing the generation of 3D training data, particularly in terms of computational efficiency.

研究动机与目标

  • 为解决在人工设计图形管线参数次优时,生成能良好泛化到真实图像的合成3D训练数据的挑战。
  • 克服黑箱优化方法在调优3D数据生成管线时的计算低效性。
  • 通过结合可微分与不可微分组件的解析梯度和近似梯度,实现合成数据生成的端到端优化。
  • 提升网络在深度估计、表面法线预测和固有图像分解等任务的真实世界基准上的泛化能力。
  • 证明混合梯度优化在准确性和训练效率上均优于先前的黑箱方法。

提出的方法

  • 将设计决策(如3D形状组合、纹理生成和光照)参数化为一个连续的实值向量β。
  • 使用随机方向上的平均有限差分近似来估计从β到生成的训练图像X的梯度,当由于逼真渲染而无法获得解析梯度时采用此方法。
  • 通过展开SGD训练步骤的反向传播计算从训练图像X到网络性能L的解析梯度,从而实现可微分性。
  • 将近似梯度(β → X)与解析梯度(X → L)结合,形成用于优化β的混合梯度∇βL。
  • 使用概率上下文无关文法(PCFG)表示复杂3D形状,以实现形状生成的可微分采样与参数化。
  • 将混合梯度应用于特定下游任务(如深度预测和固有图像分解)的β优化,使用标准深度网络(如Stacked Hourglass)。

实验结果

研究问题

  • RQ1混合梯度优化能否在生成能良好泛化到真实图像的合成3D训练数据方面优于黑箱方法?
  • RQ2结合近似梯度与解析梯度在数据生成管线中如何提升优化效率?
  • RQ3对3D形状和纹理的可微分参数化能在多大程度上提升下游3D感知网络的性能?
  • RQ4与随机或基础随机搜索基线相比,混合梯度方法是否在真实世界基准上实现了更好的泛化性能?
  • RQ5该方法能否扩展到具有多通道监督的复杂数据生成任务(如固有图像分解)?

主要发现

  • 在Basel人脸模型基准上,混合梯度方法实现了0.02256的相对差异(随机β为0.03718),相比随机初始化提升了39.5%。
  • 在深度估计任务中,混合梯度将RMSE(线性)降低至0.0293,优于基础随机搜索(0.0299)和随机β(0.1014),相比随机β误差降低了70.8%。
  • 在ShapeNet上的固有图像分解任务中,混合梯度将反照率RMSE从0.198(随机β)降至0.189,重建误差从0.169降至0.150,表现出一致的性能提升。
  • 该方法在所有评估任务中均达到最先进性能,且所需评估次数显著少于黑箱优化方法,证明了其卓越的计算效率。
  • 混合梯度方法实现了对复杂程序化管线(用于3D形状与纹理生成)的端到端优化,并在下游网络泛化性能上实现了可测量的提升。
  • 基于PCFG的形状参数化方法实现了复杂3D几何的可微分、连续优化,从而支持有效的基于梯度的调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。