Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Affect Recognition using Kinect

Amol Patwardhan, Gerald M. Knapp|arXiv (Cornell University)|Jul 9, 2016
Emotion and Mood Recognition参考文献 13被引用数 13
ひとこと要約

本稿では、感情検出のための顔、身体、手、発話の特徴をKinectを用いて捉えるマルチモーダルな感情認識システムを提案する。イベント駆動型の意思決定レベルの特徴融合とルールベースの感情テンプレートを用いた時間的特徴の統合により、教師あり学習のみに比べて高い認識精度を達成し、時間的特徴が静的ポジションベースの特徴よりも優れた性能を示した。

ABSTRACT

Affect (emotion) recognition has gained significant attention from researchers in the past decade. Emotion-aware computer systems and devices have many applications ranging from interactive robots, intelligent online tutor to emotion based navigation assistant. In this research data from multiple modalities such as face, head, hand, body and speech was utilized for affect recognition. The research used color and depth sensing device such as Kinect for facial feature extraction and tracking human body joints. Temporal features across multiple frames were used for affect recognition. Event driven decision level fusion was used to combine the results from each individual modality using majority voting to recognize the emotions. The study also implemented affect recognition by matching the features to the rule based emotion templates per modality. Experiments showed that multimodal affect recognition rates using combination of emotion templates and supervised learning were better compared to recognition rates based on supervised learning alone. Recognition rates obtained using temporal feature were higher compared to recognition rates obtained using position based features only.

研究の動機と目的

  • マルチモーダルなデータをKinectから得て、感情認識を向上させる感情に配慮したシステムの開発。
  • ルールベースの感情テンプレートと教師あり学習を組み合わせることによる感情認識の有効性の調査。
  • 時間的特徴と静的ポジションベースの特徴を用いた認識性能の比較。
  • 複数モダリティ間で多数決を用いたイベント駆動型意思決定レベルの統合の有効性の評価。
  • インタラクティブロボット、インテリジェントチューティング、感情ベースのナビゲーションへの応用の探求。

提案手法

  • Microsoft Kinectを用いてリアルタイムのカラーおよび深度センシングを行い、顔の特徴抽出と人体関節の追跡を実施。
  • 連続する動画フレーム間で複数モダリティ(顔、頭部、手、身体、発話)から時間的特徴を抽出。
  • 各モダリティごとにルールベースの感情テンプレートを適用し、観測された特徴を事前に定義された感情状態に一致させる。
  • 多数決を用いたイベント駆動型の意思決定レベルの統合により、個々のモダリティの予測結果を統合。
  • マルチモーダルデータを用いて教師ありモデルを学習し、ルールベースおよびハイブリッドアプローチと性能を比較。
  • 感情表現の動的な変化を捉えるために時間的モデリングを適用。

実験結果

リサーチクエスチョン

  • RQ1ルールベースの感情テンプレートと教師あり学習を組み合わせることで、マルチモーダルな感情認識はどの程度向上するか?
  • RQ2時間的特徴と静的ポジションベースの特徴の間で、感情認識に与える寄与度はどのように異なるか?
  • RQ3複数モダリティ間で多数決を用いたイベント駆動型の意思決定レベルの統合は、どの程度有効か?
  • RQ4Kinectデータを用いたマルチモーダル統合により、感情認識の正確性は顕著に向上するか?
  • RQ5どのモダリティ(顔、身体、手、発話)が正確な感情認識に最も寄与しているか?

主な発見

  • ルールベースの感情テンプレートと教師あり学習の組み合わせにより、教師あり学習のみに比べて高い認識率が達成された。
  • 時間的特徴は静的ポジションベースの特徴よりも顕著に優れた認識性能を示した。
  • 多数決を用いたイベント駆動型の意思決定レベルの統合により、個々のモダリティからの予測結果が効果的に統合された。
  • Kinectデータを用いたマルチモーダル統合により、単一モーダルアプローチに比べて全体的な感情認識の正確性が向上した。
  • 顔および身体の動きの特徴が、正確な感情検出に最も寄与した。
  • 本システムは、一般消費者向けの深度センサおよびRGBセンサを用いても、リアルタイムの感情認識において頑健な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。