Skip to main content
QUICK REVIEW

[论文解读] Driver Drowsiness Detection Using Ensemble Convolutional Neural Networks on YawDD

Rais Mohammad Salman, Muhammad Mahbubur Rashid|arXiv (Cornell University)|Dec 20, 2021
Sleep and Work-Related Fatigue被引用 10
一句话总结

本文提出了一种用于驾驶员瞌睡检测的集成卷积神经网络(ECNN),基于YawDD数据集,通过结合多种CNN架构以提升分类性能。ECNN在瞌睡状态下的F1分数达到0.935,在警觉状态下的F1分数达到0.978,优于单个CNN模型,证明了集成学习在提升实时瞌睡检测系统准确性与鲁棒性方面的有效性。

ABSTRACT

Driver drowsiness detection using videos/images is one of the most essential areas in today's time for driver safety. The development of deep learning techniques, notably Convolutional Neural Networks (CNN), applied in computer vision applications such as drowsiness detection, has shown promising results due to the tremendous increase in technology in the recent few decades. Eyes that are closed or blinking excessively, yawning, nodding, and occlusion are all key aspects of drowsiness. In this work, we have applied four different Convolutional Neural Network (CNN) techniques on the YawDD dataset to detect and examine the extent of drowsiness depending on the yawning frequency with specific pose and occlusion variation. Preliminary computational results show that our proposed Ensemble Convolutional Neural Network (ECNN) outperformed the traditional CNN-based approach by achieving an F1 score of 0.935, whereas the other three CNN, such as CNN1, CNN2, and CNN3 approaches gained 0.92, 0.90, and 0.912 F1 scores, respectively.

研究动机与目标

  • 开发一种基于视频的鲁棒驾驶员瞌睡检测系统,利用深度学习提升道路安全。
  • 评估多个独立CNN模型(CNN1、CNN2、CNN3)在YawDD数据集上的性能,以对瞌睡和警觉状态进行分类。
  • 设计并实现一种集成CNN(ECNN)模型,通过融合多个CNN的预测结果以提升分类准确率与泛化能力。
  • 从精确率、召回率和F1分数的角度,对比集成方法与独立CNN模型在瞌睡和警觉状态下的表现。
  • 识别现有方法的局限性,并提出未来研究方向,包括多数据集评估与实际场景部署。

提出的方法

  • 使用不同的优化设置(包括Adam和带有动量的SGD),以及不同的批量大小和学习率,在YawDD数据集上训练了四种不同的CNN架构(CNN1、CNN2、CNN3)。
  • 集成模型通过加权平均策略融合四个独立CNN的预测结果,以提升整体分类性能。
  • 每个CNN模型均训练4个周期,使用指定的迭代次数和批量大小,基于迁移学习原理,将预训练架构适配于瞌睡检测任务。
  • 通过标准指标(精确率、召回率和F1分数)在测试集、训练集和验证集上进行模型评估,并可视化混淆矩阵以分析性能。
  • 集成方法通过投票或对各网络输出的类别概率进行平均,生成最终预测,从而降低方差并提升鲁棒性。
  • 对超参数(如初始学习率0.001、批量大小32或64、优化器Adam或带有动量的SGD)进行调优,以优化模型收敛与性能。

实验结果

研究问题

  • RQ1独立CNN模型(CNN1、CNN2、CNN3)在YawDD数据集上对瞌睡和警觉状态的分类表现如何?
  • RQ2多个CNN模型的集成是否能提升F1分数与整体分类性能,相较于单个模型?
  • RQ3不同的优化技术(Adam与带有动量的SGD)及超参数对模型准确率与训练时间有何影响?
  • RQ4集成模型如何处理类别不平衡问题,并在训练集、验证集与测试集之间实现良好泛化?
  • RQ5为何使用单一数据集与孤立模型评估在真实世界瞌睡检测应用中存在局限性?

主要发现

  • 集成CNN(ECNN)在瞌睡类别上达到0.935的F1分数,在警觉类别上达到0.978,优于所有独立CNN模型。
  • CNN3在警觉状态下的精确率最高(97.7%),而集成模型在瞌睡状态下的精确率最高(97.0%)。
  • 集成模型在瞌睡状态下的召回率为90.3%,在警觉状态下的召回率为99.5%,表明其在两类中均具备强大的检测能力。
  • 在独立模型中,CNN1在警觉状态下的F1分数最高(0.972),而集成模型在瞌睡状态下的F1分数最佳(0.935)。
  • 集成模型在训练集、验证集与测试集上均表现出一致的性能,且过拟合程度极低,如混淆矩阵模式相似所示。
  • ECNN模型训练耗时67分钟27秒,准确率达到99.42%,相比独立模型展现出更优的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。