Skip to main content
QUICK REVIEW

[論文レビュー] Driver Drowsiness Detection Using Ensemble Convolutional Neural Networks on YawDD

Rais Mohammad Salman, Muhammad Mahbubur Rashid|arXiv (Cornell University)|Dec 20, 2021
Sleep and Work-Related Fatigue被引用数 10
ひとこと要約

本稿では、YawDDデータセットを用いたドライバーの眠りかけ検出のためのアンサンブル畳み込みニューラルネットワーク(ECNN)を提案する。複数のCNNアーキテクチャを組み合わせることで分類性能を向上させた。ECNNは眠りかけ状態でF1スコア0.935、覚醒状態でF1スコア0.978を達成し、個々のCNNモデルを上回り、リアルタイムの眠りかけ検出システムにおけるアンサンブル学習の有効性を示した。

ABSTRACT

Driver drowsiness detection using videos/images is one of the most essential areas in today's time for driver safety. The development of deep learning techniques, notably Convolutional Neural Networks (CNN), applied in computer vision applications such as drowsiness detection, has shown promising results due to the tremendous increase in technology in the recent few decades. Eyes that are closed or blinking excessively, yawning, nodding, and occlusion are all key aspects of drowsiness. In this work, we have applied four different Convolutional Neural Network (CNN) techniques on the YawDD dataset to detect and examine the extent of drowsiness depending on the yawning frequency with specific pose and occlusion variation. Preliminary computational results show that our proposed Ensemble Convolutional Neural Network (ECNN) outperformed the traditional CNN-based approach by achieving an F1 score of 0.935, whereas the other three CNN, such as CNN1, CNN2, and CNN3 approaches gained 0.92, 0.90, and 0.912 F1 scores, respectively.

研究の動機と目的

  • 深層学習を用いて、ドライバーの眠りかけ検出を強化するための耐障害性のある動画ベースのシステムを開発すること。
  • YawDDデータセット上での眠りかけ状態と覚醒状態の分類を目的とした、複数の個別CNNモデル(CNN1、CNN2、CNN3)の性能を評価すること。
  • 複数のCNNからの予測を統合することで分類精度と一般化性能を向上させる、アンサンブルCNN(ECNN)モデルの設計および実装すること。
  • 眠りかけ状態および覚醒状態の両方について、精度、再現率、F1スコアの観点からアンサンブル手法と個別CNNモデルを比較すること。
  • 現在のアプローチの限界を特定し、今後の研究方向性を提案すること。これには、複数のデータセットを用いた評価と実世界への導入が含まれる。

提案手法

  • Adamおよびモーメンタム付きSGDを用いた最適化設定、バッチサイズおよび学習率の変更を伴い、YawDDデータセット上で4つの異なるCNNアーキテクチャ(CNN1、CNN2、CNN3)を学習させた。
  • 予測の重み付き平均化戦略を用いて、4つの個別CNNの予測を統合することで、全体の分類性能を向上させた。
  • 各CNNモデルは、転移学習の原則に従い、事前学習済みアーキテクチャを眠りかけ検出に適応させるために、指定されたイテレーション数およびバッチサイズで4エポック分学習させた。
  • モデル評価は、テスト、訓練、検証セットにおける標準指標(精度、再現率、F1スコア)を用い、パフォーマンス分析のための混同行列を可視化した。
  • アンサンブル手法では、個々のネットワークからのクラス確率の投票または平均化を適用し、最終予測を出力することで、分散を低減し、耐障害性を向上させた。
  • 初期学習率(0.001)、バッチサイズ(32または64)、最適化手法(Adamまたはモーメンタム付きSGD)といったハイパーパrameterを調整し、モデルの収束性とパフォーマンスを最適化した。

実験結果

リサーチクエスチョン

  • RQ1個別CNNモデル(CNN1、CNN2、CNN3)は、YawDDデータセット上での眠りかけ状態と覚醒状態の分類において、どのように性能を示すか?
  • RQ2複数のCNNモデルをアンサンブル化することで、個別モデルと比較してF1スコアおよび全体の分類性能が向上するか?
  • RQ3最適化手法(Adam対モーメンタム付きSGD)およびハイパーパrameterの違いが、モデルの精度と学習時間に与える影響は何か?
  • RQ4アンサンブルモデルは、訓練、検証、テストセットの間で、クラスの不均衡と一般化性能をどのように処理するか?
  • RQ5実世界の眠りかけ検出応用において、単一のデータセットと独立したモデル評価の限界は何か?

主な発見

  • アンサンブルCNN(ECNN)は、眠りかけクラスでF1スコア0.935、覚醒クラスでF1スコア0.978を達成し、すべての個別CNNモデルを上回った。
  • CNN3は覚醒状態で最高の精度(97.7%)を記録したが、アンサンブルモデルは眠りかけ状態で最高の精度(97.0%)を記録した。
  • アンサンブルモデルは、眠りかけ状態で90.3%、覚醒状態で99.5%の再現率を記録し、両クラスにおける強力な検出能力を示した。
  • CNN1は個別モデルの中で覚醒状態で最高のF1スコア(0.972)を達成したが、アンサンブルモデルは眠りかけ状態で最高のF1スコア(0.935)を達成した。
  • アンサンブルモデルは、訓練、検証、テストセットのすべてで一貫した性能を示し、類似した混同行列のパターンから、過学習が最小限に抑えられていることが示された。
  • ECNNモデルは67分27秒の学習時間で99.42%の精度に到達し、個別モデルと比較して一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。