Skip to main content
QUICK REVIEW

[论文解读] IntFormer: Predicting pedestrian intention with the aid of the Transformer architecture

Javier Lorenzo, I. Parra|arXiv (Cornell University)|May 18, 2021
Autonomous Vehicle Technology and Safety参考文献 17被引用 15
一句话总结

IntFormer 提出了一种轻量级、实时的行人意图预测模型,采用基于 Transformer 的架构,并融合 RubiksNet 进行视频特征编码。该模型在 PIE 基准测试中实现了最先进性能(AUC:0.823),模型参数量仅为先前方法的 1/8,训练速度提升 96%,并表明自车速度是预测性能最高的输入特征。

ABSTRACT

Understanding pedestrian crossing behavior is an essential goal in intelligent vehicle development, leading to an improvement in their security and traffic flow. In this paper, we developed a method called IntFormer. It is based on transformer architecture and a novel convolutional video classification model called RubiksNet. Following the evaluation procedure in a recent benchmark, we show that our model reaches state-of-the-art results with good performance ($\approx 40$ seq. per second) and size ($8 imes $smaller than the best performing model), making it suitable for real-time usage. We also explore each of the input features, finding that ego-vehicle speed is the most important variable, possibly due to the similarity in crossing cases in PIE dataset.

研究动机与目标

  • 开发一种适用于城市自动驾驶场景的实时、高效行人意图预测模型。
  • 相比现有最先进模型(如 PCPA),提升性能并降低计算成本。
  • 研究各类输入特征(如自车速度、边界框坐标、姿态关键点、图像裁剪)对预测准确率的相对重要性。
  • 通过新型优化技术与模型压缩,提升训练效率。
  • 提供一种鲁棒且可泛化的解决方案,适用于智能车辆的部署。

提出的方法

  • IntFormer 采用混合架构,利用 RubiksNet 编码基于图像的特征(如裁剪后的边界框),同时使用 Transformer 编码器处理非图像序列数据(如自车速度、边界框坐标、姿态关键点)。
  • 模型处理 16 帧(30 fps)的输入序列,预测未来 1–2 秒内的行人过街意图(事件时间,TTE)。
  • 在独立编码后进行特征融合,使模型能有效整合空间(图像)与时间(非图像)线索。
  • 采用新型训练调度与先进优化技术,使 PIE 数据集上的训练时间缩短至 13 分钟以内,相较 PCPA 的 8 小时显著减少。
  • 模型在 [6] 提供的官方基准上进行评估,该基准在 PIE 和 JAAD 数据集上实现标准化评估。
  • 对输入特征进行系统性消融实验,以评估其对性能的独立与联合贡献。

实验结果

研究问题

  • RQ1所提出的 IntFormer 模型在 PIE 和 JAAD 基准测试中,与现有最先进模型(如 PCPA)相比,在性能与效率方面表现如何?
  • RQ2在自车速度、边界框坐标、姿态关键点与图像裁剪中,哪类输入特征对行人过街意图预测最具预测力?
  • RQ3结合图像与非图像特征在多大程度上提升了预测准确率?哪种组合能获得最优结果?
  • RQ4能否通过更小、更快的模型实现最先进性能,同时仍适用于智能车辆的实时部署?
  • RQ5为何自车速度成为最具影响力的单一特征?这反映了 PIE 数据集中行人行为模式的何种特征?

主要发现

  • IntFormer 在 PIE 基准测试中实现最先进性能,AUC 达到 0.823,优于 PCPA 及其他基线模型。
  • 该模型参数量仅为性能最佳模型(PCPA)的 1/8,且训练时间少于 13 分钟,相较 PCPA 实现 96% 的训练时间减少。
  • 仅使用自车速度一项特征即可达到最高个体性能(AUC:0.817),表明速度变化与行人过街行为之间存在强相关性。
  • 边界框坐标与自车速度组合时表现最佳,表明低维运动线索具有高度信息量。
  • 姿态关键点特征单独使用时性能与随机猜测无异(AUC:0.500),可能由于预计算检测误差与遮挡影响。
  • 当与非图像特征融合时,图像裁剪(边界框图像)显著提升性能,证明上下文视觉信息具有重要价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。