Skip to main content
QUICK REVIEW

[論文レビュー] Vision based body gesture meta features for Affective Computing

Indigo Orton|arXiv (Cornell University)|Feb 10, 2020
Emotion and Mood Recognition参考文献 49被引用数 4
ひとこと要約

本論文では、ポーズ推定から得られる動き、持続時間、驚きの要因を捉える視覚ベースのボディジェスチャー汎用特徴量を新たに導入し、特にうつ病の予測に用いる。65本のインタビュー動画から成る新しいデータセット(自己報告による苦痛度ラベル付)を用いて、線形回帰を用いた予測で82.70%のF1スコアを達成し、集約されたジェスチャー汎用特徴量が、従来の手作業特徴量やディープラーニングベースの手法とは対照的に、解釈可能で有望な代替手法であることが示された。

ABSTRACT

Early detection of psychological distress is key to effective treatment. Automatic detection of distress, such as depression, is an active area of research. Current approaches utilise vocal, facial, and bodily modalities. Of these, the bodily modality is the least investigated, partially due to the difficulty in extracting bodily representations from videos, and partially due to the lack of viable datasets. Existing body modality approaches use automatic categorization of expressions to represent body language as a series of specific expressions, much like words within natural language. In this dissertation I present a new type of feature, within the body modality, that represents meta information of gestures, such as speed, and use it to predict a non-clinical depression label. This differs to existing work by representing overall behaviour as a small set of aggregated meta features derived from a person's movement. In my method I extract pose estimation from videos, detect gestures within body parts, extract meta information from individual gestures, and finally aggregate these features to generate a small feature vector for use in prediction tasks. I introduce a new dataset of 65 video recordings of interviews with self-evaluated distress, personality, and demographic labels. This dataset enables the development of features utilising the whole body in distress detection tasks. I evaluate my newly introduced meta-features for predicting depression, anxiety, perceived stress, somatic stress, five standard personality measures, and gender. A linear regression based classifier using these features achieves a 82.70% F1 score for predicting depression within my novel dataset.

研究の動機と目的

  • 離散的ジェスチャーを超える行動パターンを捉える、身体モodalitiyの未開拓な分野に焦点を当て、うつ病の自動検出を改善するための汎用特徴量を導入すること。
  • ソース動画およびポーズデータを併記した公開可能なデータセットの不足を補うために、自己評価による苦痛度、性格、人口統計的属性ラベルを付与した65本のインタビュー録画から成る新しいデータセットを構築すること。
  • 生のポーズ時系列データを、動きのダイナミクス、持続時間、驚きを表す解釈可能な低次元の汎用特徴量に変換する特徴抽出パイプラインを開発すること。
  • 従来の機械学習分類器およびディープラーニング分類器を用いて、非臨床的うつ病、不安、ストレス、性格特性、性別予測におけるこれらの汎用特徴量の予測性能を検証すること。

提案手法

  • 2次元の関節座標を取得するために、オープンソースツールを用いて動画録画からポーズ推定を実行する。
  • 特定の身体部位(例:腕、手)における関節位置の時間的変化に基づき、動きのシーケンスとしてジェスチャーを検出する。
  • 各ジェスチャーごとに、移動量(移動距離)、持続時間(時間的スパン)、驚き(過去のパターンに基づく予測時刻からの逸脱度)といった汎用特徴量を計算する。
  • これらのジェスチャー特徴量を、平均値および標準偏差といった統計的要約を用いて、動画全体のすべてのジェスチャーにわたって集約し、コンパクトで低次元の特徴ベクトルを生成する。
  • 線形回帰分類器を用いて、集約された汎用特徴量を学習し、うつ病および他の心理的状態を予測する。
  • 本手法は、自己報告による苦痛度および人口統計的属性ラベルが付与された65本のインタビュー動画から成る新しいデータセットを用いて評価され、パイプライン全体の妥当性を検証可能である。

実験結果

リサーチクエスチョン

  • RQ1動き、持続時間、驚きといった、ジェスチャー動的特性から導出される汎用特徴量は、離散的ジェスチャー分類に比べ、心理的苦痛の予測においてより効果的であるか?
  • RQ2これらの汎用特徴量は、うつ病、不安、主観的ストレス、性格特性といった複数の心理的状態にどの程度一般化可能であるか?
  • RQ3大規模な公開データセットが存在しない状況下で、汎用特徴量を用いた線形分類器の性能は、既存の手法と比較してどの程度優れているか?
  • RQ4心理学的文献における苦痛行動(例:指をいじる、リズミカルな動き)を踏まえた場合、提案された汎用特徴量は解釈可能であるか?
  • RQ5これらの特徴量は、顔の表情や発話といった他のモodalitiyと組み合わせたマルチモーダルまたはディープラーニングフレームワークにおいて、どのような可能性を秘めているか?

主な発見

  • 提案されたジェスチャー汎用特徴量は、新しいデータセット上で線形回帰分類器を用いて82.70%のF1スコアを達成し、うつ病の分類に成功した。
  • 離散的ジェスチャー分類に依存するベースライン手法よりも優れた性能を示し、孤立したジェスチャーのラベルではなく、集約された動的特徴量の価値が裏付けられた。
  • 汎用特徴量は、うつ病にとどまらず、不安、主観的ストレス、身体的ストレス、および標準的な性格特性5つについても強い予測力を持つことが示された。
  • タイミングの予測外れを測る「驚き」特徴量は、苦痛と関連する予期せぬまたは障害を来した行動を捉える可能性を示した。
  • 本手法は解釈可能であり、心理学的理論にも裏付けられており、指をいじる、リズミカルな動きといった行動を、タイミングと繰り返しの統計的測定によってモデル化している。
  • 本研究は、限られたデータでも、ポーズ推定と単純な統計的集約を用いることで、感情計算分野において効果的で軽量な特徴量を構築できる可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。