[论文解读] IntFormer: Predicting pedestrian intention with the aid of the Transformer architecture
IntFormer 提出了一种轻量级、实时的行人意图预测模型,采用基于 Transformer 的架构,并融合 RubiksNet 进行视频特征编码。该模型在 PIE 基准测试中实现了最先进性能(AUC:0.823),模型参数量仅为先前方法的 1/8,训练速度提升 96%,并表明自车速度是预测性能最高的输入特征。
Understanding pedestrian crossing behavior is an essential goal in intelligent vehicle development, leading to an improvement in their security and traffic flow. In this paper, we developed a method called IntFormer. It is based on transformer architecture and a novel convolutional video classification model called RubiksNet. Following the evaluation procedure in a recent benchmark, we show that our model reaches state-of-the-art results with good performance ($\approx 40$ seq. per second) and size ($8 imes $smaller than the best performing model), making it suitable for real-time usage. We also explore each of the input features, finding that ego-vehicle speed is the most important variable, possibly due to the similarity in crossing cases in PIE dataset.
研究动机与目标
- 开发一种适用于城市自动驾驶场景的实时、高效行人意图预测模型。
- 相比现有最先进模型(如 PCPA),提升性能并降低计算成本。
- 研究各类输入特征(如自车速度、边界框坐标、姿态关键点、图像裁剪)对预测准确率的相对重要性。
- 通过新型优化技术与模型压缩,提升训练效率。
- 提供一种鲁棒且可泛化的解决方案,适用于智能车辆的部署。
提出的方法
- IntFormer 采用混合架构,利用 RubiksNet 编码基于图像的特征(如裁剪后的边界框),同时使用 Transformer 编码器处理非图像序列数据(如自车速度、边界框坐标、姿态关键点)。
- 模型处理 16 帧(30 fps)的输入序列,预测未来 1–2 秒内的行人过街意图(事件时间,TTE)。
- 在独立编码后进行特征融合,使模型能有效整合空间(图像)与时间(非图像)线索。
- 采用新型训练调度与先进优化技术,使 PIE 数据集上的训练时间缩短至 13 分钟以内,相较 PCPA 的 8 小时显著减少。
- 模型在 [6] 提供的官方基准上进行评估,该基准在 PIE 和 JAAD 数据集上实现标准化评估。
- 对输入特征进行系统性消融实验,以评估其对性能的独立与联合贡献。
实验结果
研究问题
- RQ1所提出的 IntFormer 模型在 PIE 和 JAAD 基准测试中,与现有最先进模型(如 PCPA)相比,在性能与效率方面表现如何?
- RQ2在自车速度、边界框坐标、姿态关键点与图像裁剪中,哪类输入特征对行人过街意图预测最具预测力?
- RQ3结合图像与非图像特征在多大程度上提升了预测准确率?哪种组合能获得最优结果?
- RQ4能否通过更小、更快的模型实现最先进性能,同时仍适用于智能车辆的实时部署?
- RQ5为何自车速度成为最具影响力的单一特征?这反映了 PIE 数据集中行人行为模式的何种特征?
主要发现
- IntFormer 在 PIE 基准测试中实现最先进性能,AUC 达到 0.823,优于 PCPA 及其他基线模型。
- 该模型参数量仅为性能最佳模型(PCPA)的 1/8,且训练时间少于 13 分钟,相较 PCPA 实现 96% 的训练时间减少。
- 仅使用自车速度一项特征即可达到最高个体性能(AUC:0.817),表明速度变化与行人过街行为之间存在强相关性。
- 边界框坐标与自车速度组合时表现最佳,表明低维运动线索具有高度信息量。
- 姿态关键点特征单独使用时性能与随机猜测无异(AUC:0.500),可能由于预计算检测误差与遮挡影响。
- 当与非图像特征融合时,图像裁剪(边界框图像)显著提升性能,证明上下文视觉信息具有重要价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。