Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

Jiyao Wang, Xiao Yang|arXiv (Cornell University)|2024. 10. 28.
Sleep and Work-Related FatiguePsychology인용 수 3
한 줄 요약

이 논문은 SAE 레벨-2/3 자율주행 환경에서 운전자의 졸림, 인지 부하, 심박수, 호흡수를 동시에 추정하기 위해 RGB 영상과 원거리 광plethysmography(rPPG)를 활용하는 계산적으로 효율적인 Mixture-of-Experts(MoE) 모델인 VDMoE를 제안한다. 얼굴 키포인트 특징과 사전 포함 정규화 손실을 통해 고정밀도를 달성하면서도 계산 비용을 최소화하였으며, 새로운 데이터셋(MCDD)과 공개 벤치마크에서 검증되었다.

ABSTRACT

Road safety remains a critical challenge worldwide, with approximately 1.35 million fatalities annually attributed to traffic accidents, often due to human errors. As we advance towards higher levels of vehicle automation, challenges still exist, as driving with automation can cognitively over-demand drivers if they engage in non-driving-related tasks (NDRTs), or lead to drowsiness if driving was the sole task. This calls for the urgent need for an effective Driver Monitoring System (DMS) that can evaluate cognitive load and drowsiness in SAE Level-2/3 autonomous driving contexts. In this study, we propose a novel multi-task DMS, termed VDMoE, which leverages RGB video input to monitor driver states non-invasively. By utilizing key facial features to minimize computational load and integrating remote Photoplethysmography (rPPG) for physiological insights, our approach enhances detection accuracy while maintaining efficiency. Additionally, we optimize the Mixture-of-Experts (MoE) framework to accommodate multi-modal inputs and improve performance across different tasks. A novel prior-inclusive regularization method is introduced to align model outputs with statistical priors, thus accelerating convergence and mitigating overfitting risks. We validate our method with the creation of a new dataset (MCDD), which comprises RGB video and physiological indicators from 42 participants, and two public datasets. Our findings demonstrate the effectiveness of VDMoE in monitoring driver states, contributing to safer autonomous driving systems. The code and data will be released.

연구 동기 및 목표

  • 졸림 또는 인지 과부하로 인한 사고를 방지하기 위해 SAE 레벨-2/3 자율주행 차량에서 실시간 비침습적 운전자 모니터링의 필수적 필요성을 해결한다.
  • 기존의 영상 기반 DMS가 전체 프레임 입력에 의존함(비용이 높음) 또는 단일 작업 추정에 국한됨(실세계의 복잡성에 부적절함)하는 한계를 극복한다.
  • 얼굴 영상과 rPPG 신호로부터 졸림, 인지 부하, 심박수, 호흡수를 동시에 추정하는 다중 작업, 효율적인 딥 러닝 프레임워크를 개발한다.
  • 기존의 생리학적 및 행동 패턴을 반영한 통계적 사전 지식을 손실 함수에 통합하여 모델의 강인성과 수렴 성능을 향상시킨다.
  • 공동으로 발생하는 인지 부하와 생리 상태를 포함한 조건부 자율주행 시나리오를 지원하기 위해 새로운 대규모 다중 모odal 데이터셋(MCDD)을 구축하고 공개한다.

제안 방법

  • 경량화된 다층 퍼셉트론(MLP)을 전문가로 사용하는 다중 작업 Mixture-of-Experts(MoE) 아키텍처인 VDMoE를 제안하여, 입력에 따라 동적으로 라우팅되며 계산 효율성을 확보한다.
  • 졸림 및 인지 상태에 관련된 시간적·공간적 동역학을 유지하면서도 계산 부담을 줄이기 위해 얼굴 키포인트 특징(예: 눈 및 입 부위)을 입력으로 사용한다.
  • 얼굴 영상에서 추출한 원거리 광plethysmography(rPPG) 신호를 활용하여 심박수 및 호흡수와 같은 생리 지표를 추정한다.
  • 기존의 통계적 사전 지식(예: 심박수/호흡수의 예상 범위)과 모델 출력을 정렬하는 새로운 사전 포함 정규화 손실 $\mathcal{L}_{\text{align}}$를 도입하여 수렴 속도 향상과 과적합 감소를 달성한다.
  • MoE 게이팅 메커니즘을 설계하여 입력을 작업별 전문가로 동적으로 라우팅함으로써 각 출력 헤드(졸림, 인지 부하, 심박수, 호흡수)에 맞는 전문화된 처리를 가능하게 한다.
  • 모델을 엔드 투 엔드로 훈련시키며, 작업별 손실과 사전 정렬 손실을 조합하여 다양한 주행 조건에서 높은 정확도와 일반화 능력을 확보한다.

실험 결과

연구 질문

  • RQ1경량화된 다중 작업 MoE 모델이 단일 추론 단계에서 RGB 영상과 rPPG 신호로부터 졸림, 인지 부하, 심박수, 호흡수 등 다양한 운전자 상태를 효과적으로 추정할 수 있는가?
  • RQ2제한된 데이터에서 통계적 사전 지식을 손실 함수에 통합함으로써 모델의 수렴과 일반화 성능가 향상되는가?
  • RQ3전체 프레임 영상 대비 얼굴 키포인트 특징을 사용할 경우 계산 비용은 얼마나 감소하며, 성능 저하 없이 다중 작업 운전자 모니터링에 적합한가?
  • RQ4환경 변화(조도, 움직임 등)가 존재하는 상황에서도 제안된 VDMoE 모델이 다양한 주행 조건과 개인 차이에 대해 얼마나 잘 일반화되는가?
  • RQ5모의 SAE 레벨-2/3 주행 시나리오에서 공동으로 발생하는 인지 부하와 졸림을 촬영한 새로 수집한 대규모 데이터셋(MCDD)이 다중 작업 DMS 모델의 더 강력하고 현실적인 평가를 지원할 수 있는가?

주요 결과

  • VDMoE는 새로 수집한 MCDD 데이터셋과 두 개의 공개 벤치마크에서 모두 졸림 탐지, 인지 부하 추정, 심박수, 호흡수 추정의 네 가지 작업에서 최신 기술 수준의 성능을 달성한다.
  • 얼굴 키포인트 특징과 MLP 기반 전문가를 활용함으로써 계산 비용을 크게 절감하였으며, 3D-CNN 또는 Transformer 기반 기준 모델 대비 FLOPs를 감소시키면서도 높은 정확도를 유지한다.
  • 사전 포함 정규화 손실 $\mathcal{L}_{\text{align}}$는 생물학적으로 타당한 범위 내에서 예측를 제약하여, 특히 데이터가 적은 환경에서 수렴 속도 향상과 과적합 감소에 기여한다.
  • 42명의 참가자가 참여한 주행 시뮬레이터에서 수집된 MCDD 데이터셋은 현실적인 인지 부하와 졸림의 공존을 촬영하여 다중 작업 DMS 모델의 더 강력한 평가를 가능하게 한다.
  • 실험 결과에 따르면 다중 작업 추정이 단일 작업 기반 모델 대비 전체 모델 성능 향상에 기여함을 확인하였으며, 이는 다중 작업 유도적 편향의 유용성을 시사한다.
  • 모델는 다양한 참가자와 주행 시나리오에 대해 잘 일반화되며, 시뮬레이터 내 조도 및 움직임 조건의 변화에도 일관된 성능을 보여 실생활 적용 가능성에 유리하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.