Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time Driver Monitoring Systems through Modality and View Analysis

Yiming Ma, Víctor Sánchez|arXiv (Cornell University)|Oct 17, 2022
Sleep and Work-Related Fatigue被引用数 4
ひとこと要約

本稿では、上位視点赤外線カメラからの単一画像入力を用いたリアルタイムドライバー監視システムを提案し、時間的モデリングを廃止することで、著しく計算量を削減しながらも最先端の性能(97.5% AUC-PR)を達成した。赤外線モダリティ単体が、マルチモーダルな動画ベースの手法を上回る効率性と正確性を示し、組み込みデバイスに実装可能な低レイテンシ推論を実現した。

ABSTRACT

Driver distractions are known to be the dominant cause of road accidents. While monitoring systems can detect non-driving-related activities and facilitate reducing the risks, they must be accurate and efficient to be applicable. Unfortunately, state-of-the-art methods prioritize accuracy while ignoring latency because they leverage cross-view and multimodal videos in which consecutive frames are highly similar. Thus, in this paper, we pursue time-effective detection models by neglecting the temporal relation between video frames and investigate the importance of each sensing modality in detecting drives' activities. Experiments demonstrate that 1) our proposed algorithms are real-time and can achieve similar performances (97.5\% AUC-PR) with significantly reduced computation compared with video-based models; 2) the top view with the infrared channel is more informative than any other single modality. Furthermore, we enhance the DAD dataset by manually annotating its test set to enable multiclassification. We also thoroughly analyze the influence of visual sensor types and their placements on the prediction of each class. The code and the new labels will be released.

研究の動機と目的

  • 組み込み自動車ハードウェアに実装可能なリアルタイムで計算効率の高いドライバー監視システム(DMS)の開発。
  • 非運転関連行動(NDRAs)を検出するにあたり、異なる視覚モダリティ(RGB、深度、IR)およびカメラ設置位置(上位、前面)の相対的な重要性の調査。
  • DADデータセットのテストセットを手動で再ラベル付けし、ドライバー行動のマルチクラス分類を可能にするよう拡張。
  • 画像ベースと動画ベースのDMSアーキテクチャにおける、正確性と推論効率のトレードオフの評価。
  • リアルタイムDMSデプロイに最も効果的な単一モダリティおよびカメラ設定の同定。

提案手法

  • 時間的モデリングを排除するため、動画クリップの代わりに単一フレーム画像を用いることで、FLOPsと推論時間を著しく削減。
  • 特徴レベルおよび意思決定レベルの統合戦略を用いて、異なるカメラビュー(上位、前面)における複数のモダリティ組み合わせ(RGB、深度、IR)を評価。
  • 特徴抽出にResNet-18およびMobileNet-V2バックボーンを用い、DADデータセット上で二値分類およびマルチクラス分類のためのモデル学習を実施。
  • ARM64およびAMD64プラットフォームにおける推論効率の比較を通じて、組み込み制約下でのリアルタイム性能の妥当性を検証。
  • マルチクラス評価およびクラスごとの分析を可能にするために、DADテストセットを特定の行動クラスに手動で再ラベル付け。
  • AUC-PRおよびAUC-ROCを用いて性能を評価し、モダリティおよびビューの組み合わせに関するアブレーションスタディを実施。

実験結果

リサーチクエスチョン

  • RQ1画像ベースのモデルは、動画ベースのモデルと同等の正確性を達成しつつ、組み込みシステムにおけるリアルタイム推論を可能にするか?
  • RQ2どの視覚モダリティ(RGB、深度、IR)およびカメラビュー(上位、前面)がドライバー行動認識に最も情報をもたらす特徴を提供するか?
  • RQ3時間的モデリングを省略すると、ドライバー監視システムの検出性能にどのような影響を与えるか?
  • RQ4データの不均衡およびバックボーンの表現能力の限界が、マルチクラス分類性能に与える影響は何か?
  • RQ5単一の最適化されたモダリティおよびビューの組み合わせが、正確性と効率性の両面でマルチモーダルな動画ベースの手法を上回るか?

主な発見

  • 画像ベースのモデルは97.5% AUC-PRおよび95.6% AUC-ROCを達成し、最先端の動画ベースモデルと同等の正確性を示しながら、FLOPsを最大10倍まで削減。
  • 上位視点赤外線(IR)モダリティ単体が、全テストされた単一モダリティ設定の中で最高の性能(97.1% AUC-PR)を示した。
  • ARM64(M1 Pro)上での画像ベースモデルの推論時間は0.03秒未満であり、45 Hz動画ストリーム(1フレームあたり≤0.3556秒)のリアルタイム要件を満たしている。
  • 特徴レベル統合は意思決定レベル統合を上回り、(上位+前面)IRの組み合わせで96.7% AUC-PRを達成。
  • 上位視点に赤外線モダリティを用いることで、スマートフォン関連の運転妨害行動と通常の運転の間の誤認識が顕著に減少し、高い識別力を持つことが示された。
  • 二値分類では優れた性能を示したが、データの不均衡およびResNet-18の表現能力の限界により、マルチクラス分類は依然として挑戦的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。