[論文レビュー] Vision Transformers and YoloV5 based Driver Drowsiness Detection Framework
本論文は、顔検出にYOLOv5を、眠り状態の二値分類にビジョントランスフォーマー(ViT)を組み合わせた、新しいドライバーの眠気検出フレームワークを提案する。UTA-RLDDデータセットで訓練されたViTモデルは、97.4%の検証精度を達成した。また、さまざまな照明条件下で収集された39名の参加者から構成される独自のデータセットでも、95.5%の精度を達成し、スマート交通システムにおける強力な実用応用性を示している。
Human drivers have distinct driving techniques, knowledge, and sentiments due to unique driving traits. Driver drowsiness has been a serious issue endangering road safety; therefore, it is essential to design an effective drowsiness detection algorithm to bypass road accidents. Miscellaneous research efforts have been approached the problem of detecting anomalous human driver behaviour to examine the frontal face of the driver and automobile dynamics via computer vision techniques. Still, the conventional methods cannot capture complicated driver behaviour features. However, with the origin of deep learning architectures, a substantial amount of research has also been executed to analyze and recognize driver's drowsiness using neural network algorithms. This paper introduces a novel framework based on vision transformers and YoloV5 architectures for driver drowsiness recognition. A custom YoloV5 pre-trained architecture is proposed for face extraction with the aim of extracting Region of Interest (ROI). Owing to the limitations of previous architectures, this paper introduces vision transformers for binary image classification which is trained and validated on a public dataset UTA-RLDD. The model had achieved 96.2\% and 97.4\% as it's training and validation accuracies respectively. For the further evaluation, proposed framework is tested on a custom dataset of 39 participants in various light circumstances and achieved 95.5\% accuracy. The conducted experimentations revealed the significant potential of our framework for practical applications in smart transportation systems.
研究の動機と目的
- 眠り運転の増加に取り組むこと。これは毎年数千件の死亡および怪我を引き起こしている。
- 従来の手法が複雑なドライバー行動特徴を捉えきれていないという限界を克服すること。
- ディープラーニングアーキテクチャを用いて、耐障害性がありリアルタイムな眠気検出システムを開発すること。
- 顔検出および分類において、既存のCNNベースおよび伝統的なコンピュータビジョン手法よりも性能を向上させること。
- 変動する照明および遮蔽状況下で、多様で現実世界の独自データセットを用いてフレームワークを検証すること。
提案手法
- ドライバー正面視点から顔の検出と関心領域(ROI)抽出を正確に行うために、カスタムYOLOv5モデルを微調整した。
- モデルの一般化性能を向上させるために、多様な照明および顔の遮蔽状況下でのデータ拡張技術を適用した。
- 眠り状態と非眠り状態の二値画像分類を目的としたビジョントランスフォーマー(ViT)アーキテクチャを設計した。
- 公開済みのUTA-RLDDデータセットを用いてViTモデルを訓練および検証し、トレーニング精度96.2%、検証精度97.4%を達成した。
- 昼間、夕方、夜間の条件で収集された39名の参加者からなる独自データセットを用いて、パイプライン全体の評価を実施した。
- モデル性能を評価するために、標準的な指標(適合率、感度、F1スコア)を用いた。
実験結果
リサーチクエスチョン
- RQ1YOLOv5に基づく顔検出システムは、リアルタイムな眠気分析に適した顔領域を効果的に抽出できるか?
- RQ2顔画像からのドライバーの眠気状態分類において、ビジョントランスフォーマーに基づく分類器は、従来のCNNと比べてどのように差をつけるか?
- RQ3変動する照明および遮蔽状況下で、独自の現実世界データセットにおける本フレームワークの性能はいかがなものか?
- RQ4YOLOv5とViTの統合は、既存の眠り検出モデルと比較して、より優れた精度と耐障害性を実現できるか?
- RQ5照明条件(昼間、夕方、夜間)は、ViTモデルの分類精度にどのように影響を与えるか?
主な発見
- ビジョントランスフォーマー(ViT)モデルは、UTA-RLDD公開データセットで97.4%の検証精度を達成し、標準ベンチマーク上での優れた一般化性能を示した。
- 39名の参加者から構成される独自データセットでは、ViTモデルが95.5%のテスト精度を達成し、強力な現実世界性能を示した。
- モデルは夕方の条件で最も高い性能(97.8%の精度)を示し、これは最適な照明条件によるものであると考えられる。一方、夜間では92.8%の精度に低下し、低照度の課題が影響したと考えられる。
- 適合率(0.97)、感度(0.98)、F1スコア(0.97)が高く、分類性能が優れており、バランスの取れた性能を示した。
- YOLOv5の顔検出部は、約95%のmAPを達成し、ROIの局所化が効果的であることを確認した。
- 特に複雑な現実世界のシナリオにおいて、CNN、GAN、および従来のコンピュータビジョン手法に基づく多くの既存手法と比較して、本フレームワークは優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。