[论文解读] Visuomotor Understanding for Representation Learning of Driving Scenes
该论文提出了一种自监督视觉-运动表征学习框架,通过融合单帧图像与自运动传感器数据,预测未来帧合成所需的密集光流。通过利用时间反演对称性(T-symmetry)与传感器增强的特征学习,该方法在语义分割任务中实现了最先进性能,优于无监督基线方法,并在自动驾驶场景理解任务中接近ImageNet监督预训练模型的表现。
Dashboard cameras capture a tremendous amount of driving scene video each day. These videos are purposefully coupled with vehicle sensing data, such as from the speedometer and inertial sensors, providing an additional sensing modality for free. In this work, we leverage the large-scale unlabeled yet naturally paired data for visual representation learning in the driving scenario. A representation is learned in an end-to-end self-supervised framework for predicting dense optical flow from a single frame with paired sensing data. We postulate that success on this task requires the network to learn semantic and geometric knowledge in the ego-centric view. For example, forecasting a future view to be seen from a moving vehicle requires an understanding of scene depth, scale, and movement of objects. We demonstrate that our learned representation can benefit other tasks that require detailed scene understanding and outperforms competing unsupervised representations on semantic segmentation.
研究动机与目标
- 开发一种自监督视觉表征学习框架,整合视觉与自运动数据,以提升驾驶场景下的场景理解能力。
- 使模型能够从单帧图像与运动传感器数据中预测密集光流,模拟未来帧的外观。
- 探究视觉-运动理解(即运动与视觉感知的关联)是否能带来比纯视觉自监督更鲁棒、更具语义意义的表征。
- 验证所学习表征在下游任务(如语义分割)中的可迁移性,特别是在低监督设置下的表现。
提出的方法
- 模型使用深度神经网络,以单张RGB图像和对应的自运动传感器数据(速度、加速度、角速度)作为输入。
- 将运动传感器数据嵌入潜在空间,并与编码后的视觉特征拼接后用于光流预测。
- 预测的光流用于将输入图像向前时间扭曲,训练损失通过扭曲图像与实际下一帧之间的像素级差异计算。
- 通过使用相同架构同时预测未来和过去帧,强制实施时间反演对称性(T-symmetry),以增强泛化能力与正则化效果。
- 该框架在大规模、自然配对的视频与传感器数据上端到端进行自监督训练,数据来源于车载摄像头与移动惯性传感器。
- 预训练完成后,使用公开数据集对模型进行语义分割微调,以评估其迁移性能。
实验结果
研究问题
- RQ1将自运动传感器数据与视觉输入结合,能否提升驾驶场景下自监督表征学习的性能?
- RQ2仅通过视觉光度损失进行光流预测的方法是否能获得比纯视觉自监督方法更优的语义理解?
- RQ3时间反演对称性在提升学习表征的稳定性与泛化能力方面起到何种作用?
- RQ4与无监督和监督基线相比,视觉-运动表征在多大程度上可迁移至下游任务(如语义分割)?
主要发现
- 所提方法在语义分割任务中相较于随机初始化和现有无监督方法取得了显著性能提升,尤其在AlexNet、VGG与ResNet架构上表现突出。
- 该模型在Cityscapes与KITTI数据集上的表现接近ImageNet预训练模型,证明了其强大的可迁移性。
- 与仅依赖视觉光度损失的光流预测方法相比,本方法表现更优,后者因依赖局部模式匹配而难以捕捉语义场景结构。
- 即使与基于深度的表征(如Depth+pose)相比,本方法仍表现更优,尤其在物体边界处,得益于更低的噪声与更稳定的监督信号。
- 消融实验验证了运动传感器融合与时间反演对称性的重要性,二者均提升了模型稳定性与表征质量。
- 传感器数据作为稳定且不受天气影响的模态,为姿态估计提供了鲁棒替代方案,避免了图像姿态估计在低质量输入下易受干扰的问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。