Skip to main content
QUICK REVIEW

[論文レビュー] Affect Intensity Estimation Using Multiple Modalities

Amol Patwardhan, Gerald M. Knapp|arXiv (Cornell University)|Jul 5, 2016
Emotion and Mood Recognition被引用数 3
ひとこと要約

本論文では、分類信頼度、特徴点のずれ、および運動速度の重み付き和を用いて、顔、身体、手、および音声の手がかりを統合するマルチモーダル感情強度推定モデルを提案する。結果は、0–1のアーザルスケールにおける感情強度推定の正確性が、音声および手のモダリティによって顕著に向上することを示しており、単一モダリティ手法を上回っている。

ABSTRACT

One of the challenges in affect recognition is accurate estimation of the emotion intensity level. This research proposes development of an affect intensity estimation model based on a weighted sum of classification confidence levels, displacement of feature points and speed of feature point motion. The parameters of the model were calculated from data captured using multiple modalities such as face, body posture, hand movement and speech. A preliminary study was conducted to compare the accuracy of the model with the annotated intensity levels. An emotion intensity scale ranging from 0 to 1 along the arousal dimension in the emotion space was used. Results indicated speech and hand modality significantly contributed in improving accuracy in emotion intensity estimation using the proposed model.

研究の動機と目的

  • 人間-コンピュータインタラクションにおける感情強度を正確に推定する課題に対処すること。
  • 顔、身体、手、および音声の複数のモダリティを統合するモデルを構築し、感情強度推定を向上させること。
  • 個々のモダリティが感情強度予測の全体的な正確性に与える寄与を評価すること。
  • Kinectおよび音声センサを用いて取得したデータを用いてモデルパラメータをキャリブレーションすること。
  • 連続的な0–1のアーザルスケールにおけるアノテート済みの強度レベルと照らし合わせてモデルを検証すること。

提案手法

  • モデルは、各モダリティからの分類信頼度レベルの重み付き和として感情強度を計算する。
  • Kinectを用いたトラッキングにより、顔および身体の動きから特徴点のずれと運動速度を抽出する。
  • 音声特徴量を処理し、最終的な重み付きスコアに感情強度推定を寄与させる。
  • 顔、身体ポーズ、手の動き、音声を含む複数のモダリティからのトレーニングデータを用いてモデルパラメータを最適化する。
  • 最終的な強度推定値は、各モダリティにおける信頼度、ずれ、および運動速度の統合から得られる。
  • 連続的な感情強度レベルを表すために、アーザル次元に沿った0–1スケールが用いられる。

実験結果

リサーチクエスチョン

  • RQ1複数のモダリティを統合することで、単一モダリティ手法と比較して感情強度推定がどの程度向上するか?
  • RQ2顔、身体、手、音声のうち、どのモダリティが感情強度推定の正確性に最も顕著に寄与しているか?
  • RQ3特徴点のずれと運動速度は、リアルタイムシステムにおける感情強度推定を向上させることができるか?
  • RQ4異なるモダリティからの分類信頼度レベルが重み付き統合モデル内でどのように相互作用するか?
  • RQ5提案されたモデルは、人間がアノテートした感情強度レベルとどの程度整合性を示すか?

主な発見

  • 音声および手のモダリティが、提案モデルにおける感情強度推定の正確性を顕著に向上させた。
  • 信頼度、ずれ、運動速度の重み付き和統合により、個々のモダリティよりも優れたパフォーマンスが得られた。
  • モデルは、0–1のアーザルスケールにおける人間がアノテートした強度レベルと、改善された整合性を示した。
  • 顔および身体のモダリティはモデルに貢献したが、音声および手のモダリティほど影響力は小さかった。
  • Kinectを用いたモーショントラッキングの活用により、ポーズおよびジェスチャー分析のための特徴抽出が向上した。
  • モデルは、マルチモーダル人間-コンピュータインタラクションにおけるリアルタイム感情強度推定の実現可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。