Skip to main content
QUICK REVIEW

[论文解读] A Computer Vision-Based Approach for Driver Distraction Recognition using Deep Learning and Genetic Algorithm Based Ensemble

Ashlesha Kumar, Kuldip Singh Sangwan|arXiv (Cornell University)|Jul 28, 2021
Ergonomics and Musculoskeletal Disorders参考文献 8被引用 7
一句话总结

该论文提出了一种基于遗传算法(GA)加权的六种深度学习模型集成方法——AlexNet、VGG-16、EfficientNet B0、普通CNN、改进的DenseNet-201以及InceptionV3 + BiLSTM——用于基于计算机视觉的实时驾驶员分心识别。该集成模型在AUC分心驾驶员数据集上达到96.37%的准确率,在State Farm分心驾驶员数据集上达到99.75%的准确率,优于先前的最先进方法,同时在GTX 1080 GPU上实现了0.024秒的快速推理时间。

ABSTRACT

As the proportion of road accidents increases each year, driver distraction continues to be an important risk component in road traffic injuries and deaths. The distractions caused by the increasing use of mobile phones and other wireless devices pose a potential risk to road safety. Our current study aims to aid the already existing techniques in driver posture recognition by improving the performance in the driver distraction classification problem. We present an approach using a genetic algorithm-based ensemble of six independent deep neural architectures, namely, AlexNet, VGG-16, EfficientNet B0, Vanilla CNN, Modified DenseNet, and InceptionV3 + BiLSTM. We test it on two comprehensive datasets, the AUC Distracted Driver Dataset, on which our technique achieves an accuracy of 96.37%, surpassing the previously obtained 95.98%, and on the State Farm Driver Distraction Dataset, on which we attain an accuracy of 99.75%. The 6-Model Ensemble gave an inference time of 0.024 seconds as measured on our machine with Ubuntu 20.04(64-bit) and GPU as GeForce GTX 1080.

研究动机与目标

  • 提高驾驶员分心分类的准确性,超越现有深度学习模型。
  • 解决视觉上相似的分心行为之间的类别混淆问题,例如“右手使用手机”与“右手打字”以及“梳妆打扮”与“与乘客交谈”。
  • 开发一种实时、高性能的系统,利用多样化深度神经网络集成,实现对驾驶员姿态和分心行为的鲁棒识别。
  • 利用遗传算法优化,自动学习集成融合的最优模型权重,从而提升整体性能。

提出的方法

  • 该方法采用六分支集成的预训练和改进的深度神经网络:AlexNet、VGG-16、EfficientNet B0、普通CNN、改进的DenseNet-201,以及结合BiLSTM用于时序建模的InceptionV3。
  • 每个模型在不同输入变体上独立训练:原始图像、皮肤分割图像以及手部/面部特定图像,以捕捉多样的视觉线索。
  • 使用遗传算法优化集成,通过进化种群中的模型权重组合来最大化验证准确率。
  • GA过程基于适应度(准确率)迭代选择、交叉和变异权重向量,最终收敛到六种模型的近优加权组合。
  • 最终集成模型通过优化后的权重聚合预测结果,输出单一高准确率分类结果。
  • 推理在搭载Ubuntu 20.04和GeForce GTX 1080 GPU的系统上进行评估,每张图像的推理时间为0.024秒。

实验结果

研究问题

  • RQ1基于遗传算法优化的多样化深度学习架构集成能否在驾驶员分心识别中超越单个模型?
  • RQ2所提出的基于GA的集成方法在减少“右手使用手机”与“右手打字”等视觉相似类别的误分类方面效果如何?
  • RQ3与先前最先进方法相比,该集成在AUC和State Farm等基准数据集上的准确率提升程度如何?
  • RQ4该集成能否在实现卓越准确率的同时保持高推理速度,以支持实时部署?

主要发现

  • 基于GA优化的六模型集成在AUC分心驾驶员数据集上达到96.37%的准确率,超过先前最先进方法的95.98%。
  • 在State Farm分心驾驶员数据集上,该集成达到99.75%的准确率,优于先前方法,包括[6]的97.16%和[7]的97.66%。
  • 该集成显著降低了关键类别的误分类:'安全驾驶'类别准确率提升2.06%,'右手使用手机'提升0.76%,'右手打字'提升0.80%,'伸手后方'提升3.36%。
  • 混淆矩阵显示,'梳妆打扮'与'与乘客交谈'因姿势相似而常被混淆,表明需要改进空间或时序建模。
  • 在GTX 1080 GPU上每张图像0.024秒的推理时间证实了其在实时部署中的可行性。
  • 该方法在多个训练/测试划分中均表现出一致的性能提升,例如在State Farm数据集上相比堆叠集成方法提升了2.75%的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。