[論文レビュー] A Computer Vision-Based Approach for Driver Distraction Recognition using Deep Learning and Genetic Algorithm Based Ensemble
本稿では、コンピュータビジョンを用いたリアルタイムのドライバーの注意散漫の認識を目的として、6つのディーブラーニングモデル—AlexNet、VGG-16、EfficientNet B0、バニラCNN、変更済みDenseNet-201、およびInceptionV3 + BiLSTM—の遺伝的アルゴリズム(GA)重み付きアンサンブルを提案する。アンサンブルは、AUC Distracted Driver Datasetで96.37%の正確度を達成し、State Farm Driver Distraction Datasetでは99.75%を記録し、先行する最先端手法を上回る性能を示した。また、GTX 1080 GPU上で0.024秒という高速な推論時間を維持した。
As the proportion of road accidents increases each year, driver distraction continues to be an important risk component in road traffic injuries and deaths. The distractions caused by the increasing use of mobile phones and other wireless devices pose a potential risk to road safety. Our current study aims to aid the already existing techniques in driver posture recognition by improving the performance in the driver distraction classification problem. We present an approach using a genetic algorithm-based ensemble of six independent deep neural architectures, namely, AlexNet, VGG-16, EfficientNet B0, Vanilla CNN, Modified DenseNet, and InceptionV3 + BiLSTM. We test it on two comprehensive datasets, the AUC Distracted Driver Dataset, on which our technique achieves an accuracy of 96.37%, surpassing the previously obtained 95.98%, and on the State Farm Driver Distraction Dataset, on which we attain an accuracy of 99.75%. The 6-Model Ensemble gave an inference time of 0.024 seconds as measured on our machine with Ubuntu 20.04(64-bit) and GPU as GeForce GTX 1080.
研究の動機と目的
- 既存のディーブラーニングモデルを上回るドライバーの注意散漫分類の正確度を向上させること。
- 「右側で電話を使う」と「右側でテキストを入力する」や「髪やメイクを整える」と「同乗者と会話する」などの類似した注意散漫行動の間での分類の混同を解消すること。
- 多様なアンサンブルによるディープニューラルネットワークを用いて、耐障害性のあるドライバーの姿勢と注意散漫の認識を実現するリアルタイムで高性能なシステムを開発すること。
- 遺伝的アルゴリズムの最適化を活用して、アンサンブル統合のための最適なモデル重みを自動で学習し、全体の性能を向上させること。
提案手法
- 本手法は、事前学習済みおよび変更済みのディープニューラルネットワークを6本のブランチとして用いるアンサンブルを採用:AlexNet、VGG-16、EfficientNet B0、バニラCNN、変更済みDenseNet-201、および時間的モデリングのためのBiLSTMを備えたInceptionV3。
- 各モデルは、異なる入力バリエーション(生画像、皮膚領域分離画像、手・顔特化画像)に対して個別に学習され、多様な視覚的手がかりを捉える。
- バリエーションの最適化には遺伝的アルゴリズム(GA)を用い、検証精度を最大化するように、モデル重みの組み合わせの集団を進化させる。
- GAプロセスは、適応度(正確度)に基づいて、繰り返し選択・交差・突然変異を実行し、6つのモデルの近似的に最適な重みの組み合わせに収束する。
- 最終的なアンサンブルモデルは、最適化された重みを用いて予測を統合し、単一の高精度な分類出力を生成する。
- 推論は、Ubuntu 20.04およびGeForce GTX 1080 GPUを搭載したシステムで評価され、1回の推論あたり0.024秒の高速性を達成した。
実験結果
リサーチクエスチョン
- RQ1多様なディーブラーニングアーキテクチャの遺伝的最適化アンサンブルは、個々のモデルを上回るドライバーの注意散漫認識性能を示せるか?
- RQ2提案手法のGAベースのアンサンブルは、視覚的に類似した分類クラス(例:「Phone Right」と「Text Right」)間の誤分類をどの程度低減できるか?
- RQ3AUCやState Farmといったベンチマークデータセットにおいて、先行する最先端手法と比較して、アンサンブルはどの程度正確度を向上させるか?
- RQ4リアルタイムデプロイメントに適した高速な推論速度を維持しながら、優れた正確度を達成できるか?
主な発見
- GA最適化6モデルアンサンブルは、AUC Distracted Driver Datasetで96.37%の正確度を達成し、以前の最先端手法(95.98%)を上回った。
- State Farm Driver Distraction Datasetでは、99.75%の正確度を達成し、[6]の97.16%および[7]の97.66%といった先行手法を上回った。
- 主なクラスにおける誤分類が低減された:「Safe Driving」は2.06%向上、「Phone Right」は0.76%向上、「Text Right」は0.80%向上、「Reaching Behind」は3.36%向上した。
- 混同行列の結果から、「髪やメイクを整える」と「同乗者と会話する」は類似した姿勢のため頻繁に混同され、空間的または時間的モデリングの改善が求められることが示された。
- GTX 1080 GPU上での1画像あたり0.024秒の推論時間は、リアルタイムデプロイメントの実現可能性を裏付けた。
- 複数のトレイン/テスト分割において一貫した性能向上を示し、State Farmデータセットではスタッキングアンサンブル手法よりも2.75%の正確度向上を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。