[论文解读] Deep3D: Fully Automatic 2D-to-3D Video Conversion with Deep Convolutional Neural Networks
本文提出 Deep3D,一种完全端到端的深度学习框架,用于利用3D电影中的立体对作为监督信号,实现自动的2D到3D视频转换。通过直接在左右视图对上进行训练以最小化像素级重建误差,模型预测出概率性视差图,并通过可微分渲染层生成右视图,实现了无需真实深度监督或人工标注的最先进性能。
As 3D movie viewing becomes mainstream and Virtual Reality (VR) market emerges, the demand for 3D contents is growing rapidly. Producing 3D videos, however, remains challenging. In this paper we propose to use deep neural networks for automatically converting 2D videos and images to stereoscopic 3D format. In contrast to previous automatic 2D-to-3D conversion algorithms, which have separate stages and need ground truth depth map as supervision, our approach is trained end-to-end directly on stereo pairs extracted from 3D movies. This novel training scheme makes it possible to exploit orders of magnitude more data and significantly increases performance. Indeed, Deep3D outperforms baselines in both quantitative and human subject evaluations.
研究动机与目标
- 解决完全自动化2D到3D视频转换的挑战,无需依赖人工深度标注或深度传感器数据。
- 通过在现有3D电影中大规模立体对上进行端到端训练,利用比传统方法多出数个数量级的数据,提升性能。
- 通过将视差预测与视图合成整合到单一可微分神经网络中,消除对独立深度估计和渲染阶段的需求。
- 通过可微分渲染层隐式处理遮挡和缺失数据,无需显式后处理修复填充。
- 通过定量评估和人类受试者研究,证明该方法在性能上优于最先进基线方法,甚至在人类感知测试中接近真实立体对表现。
提出的方法
- 模型以单张2D图像(左视图)作为输入,利用深度卷积神经网络预测概率性视差图。
- 一个可微分的基于深度图像的渲染(DIBR)层利用预测的视差图,从输入图像合成右视图。
- 网络通过在预测右视图与立体对中真实右视图之间的像素级重建损失进行端到端训练。
- 网络架构包含来自低层特征的跳跃连接以及一个选择层,以保留细节并改善特征传播。
- 通过引入多个连续的RGB帧或光流帧来探索时序信息,尽管性能提升有限。
- 通过直接在立体对上进行训练,避免了显式深度图监督,从而实现数据的可扩展利用。
实验结果
研究问题
- RQ1能否在立体对上进行端到端训练,使深度神经网络直接从左视图预测右视图,而无需真实深度图?
- RQ2在来自3D电影的大规模立体数据上进行端到端训练,是否能比传统两阶段方法带来更好的2D到3D转换性能?
- RQ3可微分渲染层是否能隐式处理遮挡和缺失数据,而无需依赖独立的修复填充算法?
- RQ4包含时序信息(如多帧或光流)如何影响合成立体视图的质量?
- RQ5在人类感知测试中,该模型的输出在多大程度上与真实立体对无法区分?
主要发现
- 在人类偏好研究中,Deep3D 相较于基线方法 Global Disparity 提升了49%,显示出显著的感知质量提升。
- 在人类受试者评估中,Deep3D 的结果在24.48%的时间内被偏好于真实立体对,而 [10] + Oracle 仅为10.27%,Global Disparity 基线仅为7.88%。
- 模型在测试集上的平均绝对误差(MAE)为6.87,消融研究显示,若移除低层特征或选择层,性能将下降。
- 直接在立体对上进行训练的效果优于先通过块匹配估计视差再进行渲染的方法,证明了端到端优化的优势。
- 通过使用五个连续的RGB帧或光流帧引入时序信息,可略微提升指标(MAE:6.81 和 6.86),但增益有限。
- 该模型在静态图像上也表现出良好泛化能力,因其不限于视频输入,因此可同时应用于2D视频和静态照片。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。