Skip to main content
QUICK REVIEW

[论文解读] Safety-Oriented Pedestrian Motion and Scene Occupancy Forecasting

Katie Luo, Sergio Casas|arXiv (Cornell University)|Jan 7, 2021
Autonomous Vehicle Technology and Safety参考文献 65被引用 4
一句话总结

该论文提出了一种场景-演员图神经网络(SA-GNN),通过联合预测行人运动和场景级占用图,以提升自动驾驶的安全性。通过建模检测到的行人之间的交互,并结合全局场景占用预测,SA-GNN在场景占用预测方面实现了最先进性能——尤其在召回率和校准性方面表现优异,同时在行人被检测后处理遗漏的情况下仍保持强劲的运动预测性能。

ABSTRACT

In this paper, we address the important problem in self-driving of forecasting multi-pedestrian motion and their shared scene occupancy map, critical for safe navigation. Our contributions are two-fold. First, we advocate for predicting both the individual motions as well as the scene occupancy map in order to effectively deal with missing detections caused by postprocessing, e.g., confidence thresholding and non-maximum suppression. Second, we propose a Scene-Actor Graph Neural Network (SA-GNN) which preserves the relative spatial information of pedestrians via 2D convolution, and captures the interactions among pedestrians within the same scene, including those that have not been detected, via message passing. On two large-scale real-world datasets, nuScenes and ATG4D, we showcase that our scene-occupancy predictions are more accurate and better calibrated than those from state-of-the-art motion forecasting methods, while also matching their performance in pedestrian motion forecasting metrics.

研究动机与目标

  • 解决因检测失败(如置信度阈值设定和非极大值抑制)导致的行人感知与运动预测中的安全关键性漏洞。
  • 提升场景占用预测的准确性与校准性,尤其针对罕见或低概率事件(如未被检测到的乱穿马路行人)。
  • 构建一个统一框架,联合预测个体行人轨迹与场景级占用情况,增强对漏检情况的鲁棒性。
  • 证明场景占用预测对于真实自动驾驶场景中高召回率、面向安全的运动规划至关重要。

提出的方法

  • SA-GNN 使用 2D 卷积特征以保留每个行人感兴趣区域(RoI)内的空间关系,减少平移不变性问题。
  • 引入 CoordConv 以在 RoI 特征中编码空间坐标,提升个体行人的定位精度。
  • 模型构建一个图结构,其中检测到的行人作为节点,另设一个专用的场景节点,实现行人与场景之间的信息传递。
  • 执行从行人到场景以及从场景到行人的消息传递,使场景能够影响行人运动,反之亦然。
  • 采用多任务损失函数,端到端联合训练,损失函数结合实例级运动预测与场景占用预测。
  • 以无实例、密集的方式预测场景占用图,避免依赖后处理检测结果。

实验结果

研究问题

  • RQ1联合预测行人运动与场景占用是否能通过弥补检测失败,提升自动驾驶的安全性?
  • RQ2在同时建模场景级占用与个体行人交互时,预测精度与校准性如何变化?
  • RQ3引入场景到行人的消息传递在多大程度上提升了对未被检测到的行人(如漏检)的鲁棒性?
  • RQ4与独立的、基于实例的运动预测方法相比,统一的场景占用与运动预测框架在召回率与可靠性方面是否表现更优?
  • RQ5端到端训练的模型是否能在真实世界数据集(如 nuScenes 和 ATG4D)上实现更好的校准性与泛化能力?

主要发现

  • 在 ATG4D 数据集上,SA-GNN 的场景占用预测 mAP 达到 19.28,显著优于基线模型 FCN(15.71)和 FCN+CoordConv(16.31)。
  • 该模型在 ATG4D 上的可靠性图接近理想状态,表明其不确定性估计校准良好,无需后处理。
  • 消融实验表明,加入场景到行人的消息传递后,未被检测到的行人在真实轨迹上的平均占用概率从 9.25% 降低至 5.46%,证明了鲁棒性的提升。
  • SA-GNN 在场景占用预测方面达到最先进性能,同时在实例级运动预测指标(如 ACE 1.21、MCE 2.55 和 NLL 4.02)上与之前方法持平或超越。
  • 该模型在低召回率区域仍保持高精度,并展现出更长的召回率尾部,表明对罕见或低置信度行人的检测能力更强。
  • 引入场景到行人的消息传递同时提升了场景占用与运动预测性能,表明场景级感知可增强整体系统鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。