Skip to main content
QUICK REVIEW

[论文解读] FIERY: Future Instance Prediction in Bird's-Eye View from Surround Monocular Cameras

Anthony Hu, Zak Murez|arXiv (Cornell University)|Apr 21, 2021
Autonomous Vehicle Technology and Safety参考文献 48被引用 14
一句话总结

FIERY 提出首个基于单目相机的端到端概率性未来实例预测模型,直接从环绕 RGB 输入回归鸟瞰图(BEV)中的多模态轨迹与分割结果,无需高精地图。该方法在 NuScenes 和 Lyft 数据集上实现了最先进性能,通过统一框架联合学习感知、传感器融合与预测。

ABSTRACT

Driving requires interacting with road agents and predicting their future behaviour in order to navigate safely. We present FIERY: a probabilistic future prediction model in bird's-eye view from monocular cameras. Our model predicts future instance segmentation and motion of dynamic agents that can be transformed into non-parametric future trajectories. Our approach combines the perception, sensor fusion and prediction components of a traditional autonomous driving stack by estimating bird's-eye-view prediction directly from surround RGB monocular camera inputs. FIERY learns to model the inherent stochastic nature of the future solely from camera driving data in an end-to-end manner, without relying on HD maps, and predicts multimodal future trajectories. We show that our model outperforms previous prediction baselines on the NuScenes and Lyft datasets. The code and trained models are available at https://github.com/wayveai/fiery.

研究动机与目标

  • 利用仅单目相机输入解决自动驾驶中未来运动与实例级动态行为预测的挑战。
  • 通过在鸟瞰图中端到端联合学习感知、传感器融合与预测,消除对高精地图和多阶段流水线的依赖。
  • 通过概率性多模态预测框架建模未来轨迹的固有随机性。
  • 通过直接从 RGB 图像回归到 BEV 表示,实现对运动规划的鲁棒、高分辨率未来场景理解。
  • 证明仅从原始相机数据端到端学习即可达到或超越依赖地图与激光雷达的基线模型性能。

提出的方法

  • 使用多相机 RGB 输入流,采用 EfficientNet-B4 主干网络提取 1/8 分辨率的特征。
  • 通过空间变换器与几何提升,利用自车运动信息将 2D 图像特征投影到 200×200 的鸟瞰图(BEV)特征图中。
  • 采用带时间块的 3D 卷积时间模型,编码过去时间步的时空动态。
  • 引入共享解码器头,配备多个输出头用于实例分割(中心度、偏移量)、光流与未来预测。
  • 采用带不确定性加权的概率损失函数,结合变分风格分布头,实现多模态未来状态预测。
  • 利用基于质心的高斯标签与基于光流的标签,对未来的实例位置与运动进行监督。

实验结果

研究问题

  • RQ1能否仅通过一个端到端模型,直接从单目相机输入预测鸟瞰图中的多模态未来实例分割与运动?
  • RQ2从原始 RGB 数据端到端学习与多阶段或地图辅助方法相比,在未来预测性能上表现如何?
  • RQ3在无显式高精地图引导的情况下,模型在多大程度上能学习到未来行为主体行为的随机性?
  • RQ4统一架构能否在无需中间监督的情况下,联合优化感知、传感器融合与未来预测?
  • RQ5在真实驾驶场景中,使用概率性多模态预测头相较于确定性基线模型,性能提升有多大?

主要发现

  • FIERY 在 NuScenes 与 Lyft 数据集上均超越以往预测基线,实现了未来实例分割与运动预测的最先进性能。
  • 该模型无需依赖高精地图即实现优异性能,证明仅通过单目相机端到端学习即可胜任复杂预测任务。
  • 采用带不确定性加权的概率损失显著提升了模型鲁棒性与多模态轨迹生成能力。
  • 结合 3D 卷积与门控循环单元的时间建模,实现了对过去时间步的精确时空特征学习。
  • 该架构仅利用相机几何与自车运动信息,成功将 2D 图像特征提升为几何一致的 BEV 表示。
  • 模型在未见场景中泛化能力良好,经 Lyft 数据集 6,174 个样本的保留测试集验证有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。