Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Transformers and YoloV5 based Driver Drowsiness Detection Framework

Ghanta Sai Krishna, Kundrapu Supriya|arXiv (Cornell University)|2022. 09. 03.
Sleep and Work-Related FatiguePsychology인용 수 19
한 줄 요약

이 논문은 얼굴 검출을 위한 YOLOv5와 졸림 상태 이진 분류를 위한 시각적 트랜스포머(ViT)를 조합한 새로운 운전자 졸림 감지 프레임워크를 제안한다. UTA-RLDD 데이터셋으로 훈련된 ViT 모델은 검증 정확도 97.4%를 기록했으며, 다양한 조명 조건에서 39명의 참가자로 구성된 자체 구축 데이터셋에서도 95.5%의 정확도를 달성하여 스마트 교통 시스템에서 뛰어난 실용성과 적용 가능성을 입증한다.

ABSTRACT

Human drivers have distinct driving techniques, knowledge, and sentiments due to unique driving traits. Driver drowsiness has been a serious issue endangering road safety; therefore, it is essential to design an effective drowsiness detection algorithm to bypass road accidents. Miscellaneous research efforts have been approached the problem of detecting anomalous human driver behaviour to examine the frontal face of the driver and automobile dynamics via computer vision techniques. Still, the conventional methods cannot capture complicated driver behaviour features. However, with the origin of deep learning architectures, a substantial amount of research has also been executed to analyze and recognize driver's drowsiness using neural network algorithms. This paper introduces a novel framework based on vision transformers and YoloV5 architectures for driver drowsiness recognition. A custom YoloV5 pre-trained architecture is proposed for face extraction with the aim of extracting Region of Interest (ROI). Owing to the limitations of previous architectures, this paper introduces vision transformers for binary image classification which is trained and validated on a public dataset UTA-RLDD. The model had achieved 96.2\% and 97.4\% as it's training and validation accuracies respectively. For the further evaluation, proposed framework is tested on a custom dataset of 39 participants in various light circumstances and achieved 95.5\% accuracy. The conducted experimentations revealed the significant potential of our framework for practical applications in smart transportation systems.

연구 동기 및 목표

  • 매년 수천 건의 사망과 부상을 유발하는 졸음 운전 증가 문제를 해결하기 위해.
  • 기존 방법들이 복잡한 운전자 행동 특징을 포착하지 못하는 한계를 극복하기 위해.
  • 딥 러닝 아키텍처를 활용해 강력하고 실시간으로 작동하는 졸림 감지 시스템을 개발하기 위해.
  • 얼굴 검출 및 분류에서 기존의 CNN 기반 및 전통적인 컴퓨터 비전 방법보다 성능을 향상시키기 위해.
  • 다양한 조명 조건과 가림 상태에서 실세계 환경에서의 프레임워크 유효성 검증을 위해.

제안 방법

  • 운전사의 정면 시각에서 정확한 얼굴 검출 및 관심 영역(ROI) 추출을 위해 맞춤형 YOLOv5 모델을 미세 조정하였다.
  • 다양한 조명 조건과 얼굴 가림 상황에서의 모델 일반화 능력을 향상시키기 위해 데이터 증강 기법을 적용하였다.
  • 졸린 상태와 비졸린 상태를 이진 분류하기 위한 시각적 트랜스포머(ViT) 아키텍처를 설계하였다.
  • 공개된 UTA-RLDD 데이터셋을 기반으로 ViT 모델을 훈련 및 검증하여 훈련 정확도 96.2%, 검증 정확도 97.4%를 달성하였다.
  • 낮, 저녁, 밤 시간대에 걸쳐 다양한 얼굴 가림 상태를 포함한 39명의 참가자로 구성된 자체 구축 데이터셋을 활용해 전체 파이프라인을 평가하였다.
  • 모델 성능 평가를 위해 정밀도, 민감도, F1-스코어와 같은 표준 지표를 사용하였다.

실험 결과

연구 질문

  • RQ1YOLOv5 기반 얼굴 검출 시스템은 실시간으로 졸림 분석에 적합한 얼굴 영역을 효과적으로 추출할 수 있는가?
  • RQ2시각적 트랜스포머 기반 분류기와 기존의 CNN 모델은 얼굴 영상에서 운전자 졸림 상태를 분류하는 데 어떻게 비교되는가?
  • RQ3변동하는 조명 조건과 가림 상태에서 본 프레임워크는 실세계 자체 구축 데이터셋에서 어떤 성능을 보이는가?
  • RQ4YOLOv5와 ViT의 통합은 기존의 졸림 감지 모델보다 뛰어난 정확도와 강건성을 제공하는가?
  • RQ5조도 조건(낮, 저녁, 밤)은 ViT 모델의 분류 정확도에 어떤 영향을 미치는가?

주요 결과

  • 시각적 트랜스포머 모델은 UTA-RLDD 공개 데이터셋에서 검증 정확도 97.4%를 기록하여 표준 기준 테스트에서 강력한 일반화 능력을 보였다.
  • 39명의 참가자로 구성된 자체 구축 데이터셋에서 ViT 모델은 테스트 정확도 95.5%를 달성하여 뛰어난 실세계 성능을 입증하였다.
  • 모델은 저녁 조건에서 가장 높은 정확도(97.8%)를 기록했으며, 이는 최적의 조명 조건 덕분이었다. 반면 야간 조건에서는 정확도가 92.8%로 가장 낮았는데, 이는 저조도 문제 때문이었다.
  • 정밀도(0.97), 민감도(0.98), F1-스코어(0.97)가 높게 유지되어 안정적이고 균형 잡힌 분류 성능을 보였다.
  • YOLOv5 얼굴 검출 모듈은 약 95%의 mAP를 기록하여 효과적인 ROI 국소화 능력을 확인하였다.
  • 특히 복잡한 실세계 상황에서 기존의 CNN, GAN, 전통적인 컴퓨터 비전 기반 방법들보다 프레임워크가 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.