Skip to main content
QUICK REVIEW

[论文解读] Predicting Take-over Time for Autonomous Driving with Real-World Data: Robust Data Augmentation, Models, and Evaluation

Akshay Rangesh, Nachiket Deo|arXiv (Cornell University)|Jul 27, 2021
Sleep and Work-Related Fatigue被引用 5
一句话总结

本文提出了一种鲁棒的深度学习框架,利用来自驾驶员朝向摄像头的真实世界数据,预测自动驾驶中的接管时间(TOT)。通过在有限的真实接管事件数据上应用新颖的数据增强和迁移学习方法,该模型利用面部、手部、脚部和视线追踪的中层与高层特征,实现了亚秒级精度的TOT预测,显著优于仅使用原始数据训练的模型。

ABSTRACT

Understanding occupant-vehicle interactions by modeling control transitions is important to ensure safe approaches to passenger vehicle automation. Models which contain contextual, semantically meaningful representations of driver states can be used to determine the appropriate timing and conditions for transfer of control between driver and vehicle. However, such models rely on real-world control take-over data from drivers engaged in distracting activities, which is costly to collect. Here, we introduce a scheme for data augmentation for such a dataset. Using the augmented dataset, we develop and train take-over time (TOT) models that operate sequentially on mid and high-level features produced by computer vision algorithms operating on different driver-facing camera views, showing models trained on the augmented dataset to outperform the initial dataset. The demonstrated model features encode different aspects of the driver state, pertaining to the face, hands, foot and upper body of the driver. We perform ablative experiments on feature combinations as well as model architectures, showing that a TOT model supported by augmented data can be used to produce continuous estimates of take-over times without delay, suitable for complex real-world scenarios.

研究动机与目标

  • 解决自动驾驶研究中真实接管事件数据有限的挑战。
  • 开发一种基于多路摄像头视角的驾驶员状态特征的鲁棒机器学习模型,用于预测接管时间(TOT)。
  • 通过新颖的数据增强和迁移学习方案,提升稀缺接管数据的模型泛化能力和性能。
  • 评估不同驾驶员状态特征(面部、手部、脚部和视线)对TOT预测精度的相对重要性。
  • 实现实时、连续的TOT估计,以确保高等级自动化驾驶中安全及时的控制权交接。

提出的方法

  • 提出一种数据增强策略,对小规模真实接管数据集进行合成扩展,以提升模型泛化能力。
  • 使用独立的深度循环网络(ID LSTMs)处理来自三路摄像头视角的序列特征:面部(视线)、手部和脚部。
  • 从应用于驾驶员朝向摄像头视频流的计算机视觉模型中提取中层与高层特征,包括3D手部距离和手-物体交互特征。
  • 采用多模态输出头,设置K=3个模式,以建模接管行为中的不确定性,增强预测鲁棒性。
  • 在增强数据上使用迁移学习训练模型,并通过消融研究分析特征组合与模型架构的影响。
  • 使用测试集上的平均绝对误差(MAE)评估性能,分别提供视线在方向盘上、脚在踏板上、手在方向盘上以及总体TOT的独立指标。

实验结果

研究问题

  • RQ1数据增强在有限真实接管数据上训练的TOT预测模型中,如何提升其性能?
  • RQ2哪些驾驶员状态特征——视线、手部、脚部或上半身——对准确预测TOT贡献最大?
  • RQ3融合多路摄像头视角特征的多模态深度学习模型,是否能优于单模态或单特征基线模型?
  • RQ4迁移学习和模型架构选择在多大程度上影响TOT预测的准确性和泛化能力?
  • RQ5随着训练数据量的增加,模型性能如何变化?是否存在收益递减现象?

主要发现

  • 在增强数据上训练的ID LSTM模型,总体TOT MAE达到0.9144秒,显著优于基线恒定预测模型(6.2073秒)。
  • 与手部相关的特征,特别是到方向盘的3D距离和手-物体交互特征,对性能提升贡献最大,相比基线使MAE降低超过50%。
  • 脚部特征显著降低了预测误差,表明专用脚部摄像头对实现高精度TOT估计至关重要。
  • 视线特征表现出相对较低的方差,信息量较少,因为视线在方向盘上的行为在接管期间高度可预测。
  • 增加立体手部特征仅带来边际收益,表明单目手部追踪结合语义特征已足以实现高性能。
  • 额外训练数据带来的性能增益微乎其微,表明在当前数据规模下,模型已接近收益递减点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。