Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

Jiyao Wang, Xiao Yang|arXiv (Cornell University)|Oct 28, 2024
Sleep and Work-Related FatiguePsychology被引用数 3
ひとこと要約

本稿では、SAE Level-2/3自動運転におけるドライバーの眠気、認知的負荷、心拍数、呼吸数を同時に推定するために、RGB動画とリモート脈波測定法(rPPG)を活用した計算効率に優れたMixture-of-Experts(MoE)モデル、VDMoEを提案する。顔のキーポoin特徴量と事前知識を組み込んだ正則化損失関数を用いることで、計算コストを最小限に抑えつつ高い精度を達成した。本研究では新規データセット(MCDD)と公開ベンチマークを用いて検証された。

ABSTRACT

Road safety remains a critical challenge worldwide, with approximately 1.35 million fatalities annually attributed to traffic accidents, often due to human errors. As we advance towards higher levels of vehicle automation, challenges still exist, as driving with automation can cognitively over-demand drivers if they engage in non-driving-related tasks (NDRTs), or lead to drowsiness if driving was the sole task. This calls for the urgent need for an effective Driver Monitoring System (DMS) that can evaluate cognitive load and drowsiness in SAE Level-2/3 autonomous driving contexts. In this study, we propose a novel multi-task DMS, termed VDMoE, which leverages RGB video input to monitor driver states non-invasively. By utilizing key facial features to minimize computational load and integrating remote Photoplethysmography (rPPG) for physiological insights, our approach enhances detection accuracy while maintaining efficiency. Additionally, we optimize the Mixture-of-Experts (MoE) framework to accommodate multi-modal inputs and improve performance across different tasks. A novel prior-inclusive regularization method is introduced to align model outputs with statistical priors, thus accelerating convergence and mitigating overfitting risks. We validate our method with the creation of a new dataset (MCDD), which comprises RGB video and physiological indicators from 42 participants, and two public datasets. Our findings demonstrate the effectiveness of VDMoE in monitoring driver states, contributing to safer autonomous driving systems. The code and data will be released.

研究の動機と目的

  • ドライバーの眠気や認知的過負荷によって引き起こされる事故を防ぐために、SAE Level-2/3自動運転車両におけるリアルタイムで非侵襲的なドライバー監視の重要性に対応する。
  • 従来の動画ベースのDMSがフルフレーム入力を必要としている(計算コストが高いため)または単一タスクの推定に依存している(現実の複雑さに対応できない)という限界を克服する。
  • 顔の動画とrPPG信号から、眠気、認知的負荷、心拍数、呼吸数を同時に推定するマルチタスクで効率的なディープラーニングフレームワークを開発する。
  • 既知の生理的および行動的パターンに一致するように予測を整列させる統計的事前知識を損失関数に統合することで、モデルの頑健性と収束性を向上させる。
  • 認知的負荷と生理的状態が同時に発生する状況を想定した、条件付き自動運転シナリオを支援するための、大規模かつマルチモodalな新規データセット(MCDD)を構築・公開する。

提案手法

  • 軽量なマルチレイヤーパーセプトロン(MLP)をエキスパートとして用いることで、入力ごとに動的にルーティングが可能な、計算効率に優れたマルチタスクMixture-of-Experts(MoE)アーキテクチャであるVDMoEを提案する。
  • 眠気や認知的状態に関連する時間的・空間的ダイナミクスを保持しつつ、計算負荷を低減するため、顔のキーポイント特徴量(例:目や口の領域)を入力として使用する。
  • 顔の動画から抽出したリモート脈波測定法(rPPG)信号を活用し、心拍数や呼吸数などの生理的指標を推定する。
  • 既知の統計的事前知識(例:HR/RRの期待される範囲)に一致するようにモデル出力を整列させる、新規の事前知識を組み込んだ正則化損失関数 $\mathcal{L}_{\text{align}}$ を導入する。これにより、収束が早まり、過学習が軽減される。
  • MoEのゲーティング機構を設計し、入力をタスク固有のエキスパートに動的にルーティングすることで、各出力ヘッド(眠気、認知的負荷、HR、RR)に特化した処理を可能にする。
  • タスク固有の損失関数と事前知識に整合する損失関数の組み合わせを用いて、エンドツーエンドでモデルを訓練することで、多様な走行条件下でも高い精度と一般化性能を確保する。

実験結果

リサーチクエスチョン

  • RQ1RGB動画とrPPG信号から、1回の推論プロセスで複数のドライバー状態(眠気、認知的負荷)および生理的指標(HR、RR)を効率的かつ高精度に推定できる、軽量でマルチタスクなMoEモデルは実現可能か?
  • RQ2限られたデータ環境下で、損失関数に統計的事前知識を組み込むことで、ドライバー状態推定におけるモデルの収束性と一般化性能はどのように向上するか?
  • RQ3フルフレーム動画ではなく顔のキーポイント特徴量を用いることで、マルチタスクドライバー監視における計算コストはどの程度低減できるか、性能に悪影響は及ばないか?
  • RQ4環境要因(照明、動きなど)の変動が生じる状況下でも、提案されたVDMoEモデルは多様なドライバーと走行シナリオにわたってどれほど一般化性能を発揮するか?
  • RQ5シミュレートされたSAE Level-2/3走行シナリオで、認知的負荷と眠気が同時に発生する状況を捉えた、新たに収集された大規模データセット(MCDD)は、マルチタスクDMSモデルのより強固で現実的な評価を可能にするか?

主な発見

  • VDMoEは、新たに収集したMCDDデータセットおよび2つの公開ベンチマークの両方で、眠気検出、認知的負荷推定、心拍数、呼吸数の4つのタスクにおいて、最先端の性能を達成した。
  • 顔のキーポイント特徴量とMLPベースのエキスパートを用いることで、3D-CNN やTransformerベースのベースラインと比較してFLOPsを大幅に削減しながらも、高い精度を維持した。
  • 事前知識を組み込んだ正則化損失関数 $\mathcal{L}_{\text{align}}$ により、特にデータが少ない状況下でもトレーニングの収束が早まり、過学習が抑制された。これは、予測値が生物学的に妥当な範囲内に制約されることによる。
  • 42名の参加者を対象にドライビングシミュレータで収集したMCDDデータセットは、認知的負荷と眠気の現実的な同時発現を捉えており、マルチタスクDMSの評価をより強固にする。
  • 実験的結果から、複数のドライバー状態を同時に推定することで、単一タスクベースラインと比較して全体的なモデル性能が向上することが示された。これは、マルチタスクのインダクティブバイアスの利点を示している。
  • モデルは、異なる照明条件や動きの影響があるシミュレータ環境下でも、参加者や走行シナリオにかかわらず一貫した性能を示しており、実世界への実装可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。