[논문 리뷰] A Computer Vision-Based Approach for Driver Distraction Recognition using Deep Learning and Genetic Algorithm Based Ensemble
이 논문은 컴퓨터 비전을 사용하여 실시간으로 운전 중 주의산산을 인식하기 위해 유전 알고리즘(GA) 가중치를 적용한 6개의 딥 러닝 모델—AlexNet, VGG-16, EfficientNet B0, Vanilla CNN, 수정된 DenseNet-201, InceptionV3 + BiLSTM—의 앙상블을 제안한다. 이 앙상블은 AUC Distracted Driver Dataset에서 96.37%의 정확도를, State Farm Driver Distraction Dataset에서는 99.75%의 정확도를 기록하여 이전의 최고 성능 기준을 초월하였으며, GTX 1080 GPU에서 0.024초의 빠른 추론 시간을 유지한다.
As the proportion of road accidents increases each year, driver distraction continues to be an important risk component in road traffic injuries and deaths. The distractions caused by the increasing use of mobile phones and other wireless devices pose a potential risk to road safety. Our current study aims to aid the already existing techniques in driver posture recognition by improving the performance in the driver distraction classification problem. We present an approach using a genetic algorithm-based ensemble of six independent deep neural architectures, namely, AlexNet, VGG-16, EfficientNet B0, Vanilla CNN, Modified DenseNet, and InceptionV3 + BiLSTM. We test it on two comprehensive datasets, the AUC Distracted Driver Dataset, on which our technique achieves an accuracy of 96.37%, surpassing the previously obtained 95.98%, and on the State Farm Driver Distraction Dataset, on which we attain an accuracy of 99.75%. The 6-Model Ensemble gave an inference time of 0.024 seconds as measured on our machine with Ubuntu 20.04(64-bit) and GPU as GeForce GTX 1080.
연구 동기 및 목표
- 기존의 딥 러닝 모델들을 초월하여 운전 중 주의산산 분류의 정확도를 향상시키는 것.
- 유사한 주의산산 행동 간의 분류 혼동 문제를 해결하는 것, 예를 들어 'Phone Right'과 'Text Right', 'Hair and Makeup'와 'Talking to Passenger' 사이의 혼동.
- 다양한 딥 네트워크 앙상블을 활용하여 실시간으로 고성능의 시스템을 개발하여 안정적인 운전 자세 및 주의산산 인식을 수행하는 것.
- 유전 알고리즘 최적화를 통해 앙상블 융합을 위한 최적의 모델 가중치를 자동으로 학습시켜 전체 성능을 향상시키는 것.
제안 방법
- 이 방법은 사전 훈련된 및 수정된 딥 네트워크 6개의 브랜치로 구성된 앙상블을 사용한다: AlexNet, VGG-16, EfficientNet B0, Vanilla CNN, 수정된 DenseNet-201, 그리고 시간적 모델링을 위한 BiLSTM가 통합된 InceptionV3.
- 각 모델은 서로 다른 입력 변형—원본 이미지, 피부 분할 이미지, 손 및 얼굴 전용 이미지—에서 독립적으로 훈련되어 다양한 시각적 단서를 포착한다.
- 유전 알고리즘을 사용하여 앙상블를 최적화하며, 검증 정확도를 극대화하기 위해 모델 가중치 조합의 집단을 진화시킨다.
- GA 과정은 적합도(정확도)를 기반으로 가중치 벡터를 반복적으로 선택, 교차, 돌연변이를 통해 진화시키며, 최종적으로 6개의 모델에 대한 근사 최적의 가중치 조합에 수렴한다.
- 최종 앙상블 모델은 최적화된 가중치를 사용하여 예측를 융합하여 단일이고 고정확도의 분류 출력을 생성한다.
- 추론은 Ubuntu 20.04와 GeForce GTX 1080 GPU를 탑재한 시스템에서 평가되었으며, 이미지당 0.024초의 추론 시간을 기록했다.
실험 결과
연구 질문
- RQ1다양한 딥 러닝 아키텍처로 구성된 유전 알고리즘 최적화 앙상블이 개별 모델을 초월하여 운전 중 주의산산 인식 성능을 향상시킬 수 있는가?
- RQ2제안된 GA 기반 앙상블은 'Phone Right'과 'Text Right'처럼 시각적으로 유사한 분류 간의 오분류를 어떻게 감소시키는가?
- RQ3AUC 및 State Farm와 같은 벤치마크 데이터셋에서 이전의 최고 성능 기준 대비 앙상블이 정확도를 얼마나 향상시키는가?
- RQ4실시간 구현을 위해 높은 추론 속도를 유지하면서도 뛰어난 정확도를 달성할 수 있는가?
주요 결과
- GA 최적화 6모델 앙상블은 AUC Distracted Driver Dataset에서 96.37%의 정확도를 기록하여 이전 최고 성능인 95.98%를 초월하였다.
- State Farm Driver Distraction Dataset에서는 99.75%의 정확도를 기록하여, [6]에서의 97.16% 및 [7]에서의 97.66% 결과를 모두 초월하였다.
- 주요 클래스에서 오분류가 감소한 것으로 나타났다: 'Safe Driving'는 2.06% 향상, 'Phone Right'는 0.76%, 'Text Right'는 0.80%, 'Reaching Behind'는 3.36% 향상되었다.
- 혼동 행렬 분석 결과, 'Hair and Makeup'와 'Talking to Passenger'는 유사한 자세로 인해 자주 혼동되었으며, 이는 공간적 또는 시간적 모델링 향상의 필요성을 시사한다.
- GTX 1080 GPU에서 이미지당 0.024초의 추론 시간은 실시간 구현 가능성을 확인한다.
- 여러 개의 훈련/테스트 분할에 걸쳐 일관된 성능 향상을 보였으며, State Farm 데이터셋에서 스태킹 앙상블 방법 대비 2.75%의 정확도 향상을 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.