[论文解读] Learning Independent Object Motion from Unlabelled Stereoscopic Videos
本文提出一种自监督深度学习框架,通过仅利用2D目标边界框作为弱监督信号,从未标注的立体视频序列中预测3D场景光流和深度。该方法结合平面扫掠体积与实例感知的几何一致性损失,联合估计深度、每个物体的3D运动以及实例分割掩码,在KITTI基准测试中实现了深度、光流和场景光流任务的最先进性能,且无需任何真实运动或深度标签。
We present a system for learning motion of independently moving objects from stereo videos. The only human annotation used in our system are 2D object bounding boxes which introduce the notion of objects to our system. Unlike prior learning based work which has focused on predicting dense pixel-wise optical flow field and/or a depth map for each image, we propose to predict object instance specific 3D scene flow maps and instance masks from which we are able to derive the motion direction and speed for each object instance. Our network takes the 3D geometry of the problem into account which allows it to correlate the input images. We present experiments evaluating the accuracy of our 3D flow vectors, as well as depth maps and projected 2D optical flow where our jointly learned system outperforms earlier approaches trained for each task independently.
研究动机与目标
- 从无标注的立体视频序列中,无需密集监督,独立学习3D物体运动与深度。
- 仅使用2D目标边界框作为弱监督,实现准确的3D场景光流与深度预测。
- 设计一种几何感知的网络架构,通过平面扫掠体积编码3D结构,以提升场景推理能力。
- 以图像一致性作为主要学习信号,联合优化深度、3D场景光流与实例分割。
- 证明联合学习相比独立训练,能在各子任务(深度、光流、实例分割)上均取得性能提升。
提出的方法
- 网络使用平面扫掠体积处理立体图像对,以编码跨视角和时间的3D几何关系。
- 在单次前向传播中预测实例特定的3D场景光流、深度图与实例掩码,利用现成检测器提供物体级监督。
- 对每个物体提议区域(RoI)应用一种新型一致性损失:将从预测光流与深度合成的图像块与原始输入图像块进行比较,以强制实现几何一致性。
- 使用立体重投影损失监督深度预测,确保扭曲图像与原始输入匹配。
- 应用一个独立的优化网络,通过U-Net架构对扭曲图像和光流进行细化,以提升光流预测性能。
- 整个系统通过仅使用图像重建损失和来自边界框的弱实例级监督,端到端进行训练。
实验结果
研究问题
- RQ1能否仅使用2D目标边界框作为监督信号,从未标注的立体视频中准确预测3D场景光流与深度?
- RQ2与独立训练相比,联合学习深度、3D光流与实例分割是否能提升所有子任务的性能?
- RQ3应用于每个物体提议区域的几何一致性损失,能否有效监督实例特定的3D运动预测?
- RQ4在KITTI基准测试中,该方法与自监督及有监督基线相比,在深度、光流与场景光流任务上的表现如何?
- RQ5该模型能否在不依赖合成数据或密集标注的情况下,泛化到真实世界的动态场景?
主要发现
- 在KITTI 2015立体训练集上,该方法在测试时的深度误差(RMSE)达到3.896,优于其他自监督方法与传统方法。
- 在KITTI 2015光流基准测试中,该模型在所有区域的平均端点误差(EPE)为5.39,在非遮挡区域为4.97,优于其他自监督方法。
- 实例级IoU提升至0.655,图像级IoU达到0.782,表明对运动物体的检测与分割准确。
- 当将3D光流投影至2D时,该方法在自监督方法中实现了最低的EPE,经优化后的版本在所有区域达到5.13的EPE。
- 消融实验表明,若移除RoI一致性损失,性能显著下降,验证了其在监督中的关键作用。
- 联合学习结合几何一致性损失,相比独立训练各任务,能在深度、光流与实例分割任务上均取得更优性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。