Skip to main content
QUICK REVIEW

[論文レビュー] Deep Head Pose Estimation from Depth Data for In-car Automotive Applications

Marco Venturelli, Guido Borghi|arXiv (Cornell University)|Mar 6, 2017
Face recognition and analysis被引用数 4
ひとこと要約

本論文は、1つのセンサーからの生の深度データのみを用いて、顔のランドマークやRGBデータを必要とせずに、リアルタイムでエンドツーエンドのディーブラーニング手法を用いて頭部姿勢推定を実現する手法を提案する。この手法は、軽量なCNNを用いて直接ピッチ、ロール、ヨーの角度を回帰するもので、1フレームあたり10ms未塔の推論時間で、Biwi Kinect Head Poseデータセットにおいて最先端の精度(ピッチ2.8° ± 3.1°、ロール2.3° ± 2.9°、ヨー3.6° ± 4.1°)を達成した。

ABSTRACT

Recently, deep learning approaches have achieved promising results in various fields of computer vision. In this paper, we tackle the problem of head pose estimation through a Convolutional Neural Network (CNN). Differently from other proposals in the literature, the described system is able to work directly and based only on raw depth data. Moreover, the head pose estimation is solved as a regression problem and does not rely on visual facial features like facial landmarks. We tested our system on a well known public dataset, Biwi Kinect Head Pose, showing that our approach achieves state-of-art results and is able to meet real time performance requirements.

研究の動機と目的

  • 生の深度データのみを用いて、自動車環境におけるリアルタイムで高精度な頭部姿勢推定を実現すること。
  • RGBデータや顔のランドマークに依存する既存手法の制限を克服し、手動の初期化を不要にする。
  • 速度を犠牲にせずに、頭部姿勢の角度を回帰する問題を効率的に解けるディープラーニングフレームワークを構築すること。
  • 自動車環境で一般的な明るさの変動や部分的遮蔽に耐えうる高い性能を実現すること。

提案手法

  • 生の深度画像をエンドツーエンドに学習した軽量な畳み込みニューラルネットワーク(CNN)アーキテクチャを用い、頭部姿勢の角度を直接回帰する。
  • 頭部姿勢推定を回帰タスクとして扱い、顔のランドマーク検出を経由せずに、深度入力から3つのオイラー角(ピッチ、ロール、ヨー)へのマッピングを学習する。
  • 真値の頭部中心に基づいた動的クロッピング戦略を採用し、ネットワークが顔領域に集中できるようにすることで、局所化精度を向上させる。
  • 予測値と真値の間の角度誤差を最小化するため、回帰損失関数を用いてネットワークを学習する。
  • 浅いネットワーク設計を採用することで、GPU上での1フレームあたり10ms未塔の推論時間を達成し、リアルタイム性能を最適化する。
  • 深度データのみの頭部姿勢推定のための標準評価プロトコルに従い、Biwi Kinect Head Poseデータセット上で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1生の深度データのみを用いて、RGBデータや顔のランドマークに依存せずに、高精度な頭部姿勢推定が可能か。
  • RQ2CNNベースの回帰アプローチは、深度データに対して、従来の手法と比較して精度とリアルタイム性能の面でどのように差をつけるか。
  • RQ3軽量なCNNは、自動車用途における厳密なリアルタイム制約を満たしつつ、高い精度を維持できるか。
  • RQ4自動車環境の深度データに一般的に見られる視覚的アーティファクトや部分的遮蔽に対して、提案手法はどれほど耐性を示すか。

主な発見

  • 提案手法は、Biwi Kinect Head Poseデータセットにおいて最先端の性能を達成し、ピッチの平均角度誤差が2.8° ± 3.1°、ロールが2.3° ± 2.9°、ヨーが3.6° ± 4.1°であった。
  • GPU上では1フレームあたり10ms未塔で深度画像を処理でき、車載監視システムにおけるリアルタイム要件を満たした。
  • RGBと深度データを併用する他の最先端手法をも上回り、深度データのみを用いた学習の有効性を示した。
  • ノイズ、穴、部分的遮蔽が生じる低品質な深度入力に対しても、良好な一般化性能を示し、自動車環境での耐障害性を確認した。
  • 顔のランドマーク検出を排除することで、パイプラインが簡素化され、失敗要因が減少し、動的なドライブシナリオにおける信頼性が向上した。
  • 今後の研究において、時間的モデリングやRGBまたは赤外データとの融合を組み込むことで、さらなる耐障害性の向上が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。