[论文解读] View Extrapolation of Human Body from a Single Image
本文提出了一种几何感知的深度学习框架,用于从单张图像实现人体的新型视图合成,将任务分解为形状估计与基于视角的光流预测。通过显式建模三维几何结构并采用带有几何约束的两阶段网络,该方法在具有大姿态变化和遮挡的活动可变形人体上显著优于端到端CNN,提升了合成精度。
We study how to synthesize novel views of human body from a single image. Though recent deep learning based methods work well for rigid objects, they often fail on objects with large articulation, like human bodies. The core step of existing methods is to fit a map from the observable views to novel views by CNNs; however, the rich articulation modes of human body make it rather challenging for CNNs to memorize and interpolate the data well. To address the problem, we propose a novel deep learning based pipeline that explicitly estimates and leverages the geometry of the underlying human body. Our new pipeline is a composition of a shape estimation network and an image generation network, and at the interface a perspective transformation is applied to generate a forward flow for pixel value transportation. Our design is able to factor out the space of data variation and makes learning at each step much easier. Empirically, we show that the performance for pose-varying objects can be improved dramatically. Our method can also be applied on real data captured by 3D sensors, and the flow generated by our methods can be used for generating high quality results in higher resolution.
研究动机与目标
- 解决从单张图像中合成高度活动、可变形人体的准确新型视图的挑战。
- 克服端到端CNN在处理人体图像中大姿态变化和遮挡时的局限性。
- 通过显式建模三维几何结构并解耦形状估计与图像生成,提升视图合成质量。
- 通过在合成数据上训练的模型生成上采样光流,实现实现高分辨率合成。
- 通过深度网络的领域自适应,在真实世界RGB-D数据上展示鲁棒性。
提出的方法
- 该方法采用两阶段流程:首先使用专用的形状估计网络从输入图像中估计深度图(形状)。
- 随后通过视角投影层计算前向光流,将源图像像素映射到目标视图位置。
- 图像生成网络利用预测的光流对特征进行变形并合成新型视图,同时受到图像损失和光流损失的联合监督。
- 该架构将形状估计、光流预测与图像合成解耦,降低了每个子任务的复杂度。
- 模型采用多任务监督进行训练:在图像重建上使用L1损失,在预测光流上使用光流一致性损失。
- 对于真实世界数据,使用来自Kinect2的8,000帧RGB-D数据对深度网络进行微调,以应对领域偏移问题。
实验结果
研究问题
- RQ1与端到端深度学习相比,显式建模三维几何结构是否能提升对高度活动人体的新型视图合成性能?
- RQ2将形状估计与光流预测及图像生成分离,是否能带来更好的泛化能力并减少合成视图中的模糊?
- RQ3在处理大姿态变化和自遮挡时,几何增强的CNN是否能优于纯端到端学习的光流预测?
- RQ4当从合成数据迁移到真实世界RGB-D数据时,该方法的有效性如何?
- RQ5预测的光流是否可用于通过上采样变形实现高分辨率结果的生成?
主要发现
- 与VSAP和VSAP+M.+F.相比,所提方法在光流精度上显著更优,后者直接预测光流而无几何监督。
- 在合成基准测试中,该方法在MSE和SSIM指标上均优于当前最先进方法,其中在“chair”类别上MSE降低7.2%,在“car”类别上SSIM提升1.5%。
- 即使在未微调的情况下,模型在真实世界数据上仍能保持姿态结构,且对深度网络进行微调可显著提升视觉质量。
- 高分辨率结果(500×500)显示出良好的面部细节保留与更少的模糊,证明了上采样光流变形的有效性。
- 该方法对大姿态变化和自遮挡具有鲁棒性,与基线方法相比,在肢体和头部区域生成了更清晰的图像。
- 消融研究证实,仅靠CNN难以学习准确的像素级视角投影,验证了显式几何建模的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。