Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Future Prediction for Video Scene Understanding

Anthony Hu, Fergal Cotter|arXiv (Cornell University)|Mar 13, 2020
Human Pose and Action Recognition参考文献 67被引用 11
一句话总结

本文提出了一种用于自动驾驶中概率性未来预测的新型深度学习框架,通过条件变分自编码器(CVAE)从RGB视频中联合建模自车运动、静态场景和动态目标运动。该模型学习一种紧凑的潜在表征,实现多样化且一致的未来采样,在Cityscapes数据集上显著提升了未来预测准确率与端到端驾驶策略性能,感知能力提升20.0%,转向误差降低33%。

ABSTRACT

We present a novel deep learning architecture for probabilistic future prediction from video. We predict the future semantics, geometry and motion of complex real-world urban scenes and use this representation to control an autonomous vehicle. This work is the first to jointly predict ego-motion, static scene, and the motion of dynamic agents in a probabilistic manner, which allows sampling consistent, highly probable futures from a compact latent space. Our model learns a representation from RGB video with a spatio-temporal convolutional module. The learned representation can be explicitly decoded to future semantic segmentation, depth, and optical flow, in addition to being an input to a learnt driving policy. To model the stochasticity of the future, we introduce a conditional variational approach which minimises the divergence between the present distribution (what could happen given what we have seen) and the future distribution (what we observe actually happens). During inference, diverse futures are generated by sampling from the present distribution.

研究动机与目标

  • 解决在高不确定性下复杂城市驾驶场景中建模随机性、多智能体交互的挑战。
  • 开发一种统一的深度学习架构,以概率化方式联合预测语义分割、深度图和光流。
  • 通过从视频中学习的未来感知、运动感知表征,提升自动驾驶车辆控制性能。
  • 通过潜在空间采样显式建模不确定性,实现多样化且合理的未来场景生成。
  • 证明未来预测监督可超越直接控制优化,提升端到端自动驾驶策略性能。

提出的方法

  • 采用新颖的时空卷积架构,结合分层时空分解,从RGB视频中提取运动感知特征。
  • 使用条件变分自编码器(CVAE)建模未来状态的当前分布,最小化预测分布与真实未来分布之间的KL散度。
  • 使用KL散度损失进行模型训练,使基于当前观测的当前分布与真实未来分布对齐,从而在推理阶段实现未来采样。
  • 显式解码潜在表征,以在多个时间步上预测未来的语义分割、深度图和光流。
  • 将学习到的时间表征作为可微分驾驶策略网络的输入,实现端到端训练,并引入未来预测监督。
  • 使用当前分布的微分熵作为不确定性度量,识别具有高随机性的复杂场景。

实验结果

研究问题

  • RQ1单一深度学习模型能否从RGB视频中以概率化方式联合预测自车运动、静态场景和动态目标运动?
  • RQ2在潜在空间中建模不确定性在多大程度上提升了预测未来场景的多样性与合理性?
  • RQ3未来预测监督在多大程度上提升了端到端自动驾驶策略的性能?
  • RQ4模型能否通过分析预测分布的熵,自动检测高不确定性场景(如交叉路口)?
  • RQ5联合预测多种模态(分割、深度、光流)是否能生成优于单模态或非概率基线的时序表征?

主要发现

  • 所提模型在Cityscapes数据集上未来语义分割任务中达到最先进性能,分别在第5帧和第10帧预测时取得0.464和0.416的IoU分数。
  • 概率模型相比静态单帧基线,使驾驶策略性能提升20.0%(感知准确率),转向误差降低33%。
  • 通过从当前分布采样,模型生成多样化且视觉上合理的未来场景,不同噪声向量引发不同行为(如停车与继续行驶)。
  • 潜在空间中的高熵区域对应复杂场景(如交叉路口),存在多种合理未来,验证了模型的不确定性估计能力。
  • 概率性模型相比其确定性版本,在感知增益上提升7.4%,速度降低提升3.5%,证明了不确定性建模的优势。
  • 与非未来感知基线相比,未来预测监督使转向性能提升27%,速度控制性能提升38%,表明预测性表征学习可增强控制策略泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。