Skip to main content
QUICK REVIEW

[论文解读] Driver Intention Anticipation Based on In-Cabin and Driving Scene Monitoring

Yao Rong, Zeynep Akata|arXiv (Cornell University)|Jun 20, 2020
Autonomous Vehicle Technology and Safety参考文献 18被引用 4
一句话总结

本文提出了一种端到端的深度学习框架,通过基于ConvLSTM的自编码器联合建模车内驾驶员行为与车外交通场景运动,实现运动特征提取,并采用一种新型联合分类器。该方法在Brain4cars数据集上实现了83.98%的准确率和84.30%的F1分数,表明车内与车外特征具有互补性,显著优于单流方法的变道意图预测性能。

ABSTRACT

Numerous car accidents are caused by improper driving maneuvers. Serious injuries are however avoidable if such driving maneuvers are detected beforehand and the driver is assisted accordingly. In fact, various recent research has focused on the automated prediction of driving maneuver based on hand-crafted features extracted mainly from in-cabin driver videos. Since the outside view from the traffic scene may also contain informative features for driving maneuver prediction, we present a framework for the detection of the drivers' intention based on both in-cabin and traffic scene videos. More specifically, we (1) propose a Convolutional-LSTM (ConvLSTM)-based auto-encoder to extract motion features from the out-cabin traffic, (2) train a classifier which considers motions from both in- and outside of the cabin jointly for maneuver intention anticipation, (3) experimentally prove that the in- and outside image features have complementary information. Our evaluation based on the publicly available dataset Brain4cars shows that our framework achieves a prediction with the accuracy of 83.98% and F1-score of 84.3%.

研究动机与目标

  • 通过整合车内驾驶员行为与车外交通场景视频数据,提升驾驶员变道意图预测性能。
  • 开发一种端到端学习框架,避免对交通场景特征进行人工编码,从而提升实际部署的可行性。
  • 使用基于ConvLSTM的自编码器从车外视频中提取有意义的运动特征,有效利用外部场景信息。
  • 设计一种轻量化、参数高效的模型,适用于资源受限的移动或车载平台。
  • 验证车内与车外视频流为意图预测提供了互补且相互增强的信息。

提出的方法

  • 使用基于ConvLSTM的自编码器,从连续车外视频帧的光流表示中提取运动特征。
  • 采用3D ResNet-50提取车内驾驶员视频的时空特征,捕捉头部运动与手势。
  • 设计一种新型分类器架构,集成外部特征的运动解码器,并以端到端可训练的方式联合处理车内与车外特征。
  • 使用平衡损失函数进行模型训练,以应对五类变道类型(如左转、右转、变道等)之间的类别不平衡问题。
  • 在公开的Brain4cars数据集上采用5折交叉验证进行模型评估,并对单流与双流输入进行消融实验。
  • 未使用任何手工设计或人工编码的特征,所有特征均从原始视频数据端到端学习得到。

实验结果

研究问题

  • RQ1当与车内特征结合时,从车外交通视频中提取的运动特征是否能提升驾驶员变道意图预测性能?
  • RQ2采用车内与车外视频流联合建模的方法是否优于单流基线方法?
  • RQ3轻量化、端到端的深度学习框架是否能在无需人工特征工程的前提下,有效从有限的真实驾驶数据中学习?
  • RQ4车外视频提供的信息是否与车内特征互补,还是在融合后会降低性能?
  • RQ5所提出的框架是否能在参数量更少的情况下实现高准确率,优于以往的大规模模型?

主要发现

  • 所提出的双流框架在Brain4cars数据集上实现了83.98%的准确率与84.30%的F1分数,显著优于单流基线方法。
  • 仅使用车外视频时,模型准确率达到60.87%,F1分数为66.38%,表明交通场景运动中包含有价值的预测信号。
  • 尽管参数量更少,该模型在准确率上比使用3D ResNet-101的先前最先进方法高出8.48个百分点,在F1分数上高出11.10个百分点。
  • 该框架无需基于阈值的预测策略,因其在所有变道类别中均保持高置信度,且不依赖于阈值设定。
  • 结果证实,车内与车外特征具有互补性,联合建模相比孤立流方法性能更优。
  • 该模型参数高效,当同时使用双流时,参数量仅为5792万,适用于移动或嵌入式平台部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。