Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Appropriate Facial Reaction Generation in Dyadic Interaction Settings: What, Why and How?

Siyang Song, Micol Spitale|arXiv (Cornell University)|Feb 13, 2023
Color perception and design被引用数 5
ひとこと要約

本論文は、二重対話における複数の適切な顔の反応生成(fMARG)という新しいタスクを導入し、深層学習を用いて文脈的に適切な複数の顔の反応を予測・生成・評価するフレームワークを提案する。本研究では、正確性、多様性、現実性、同期性の4つの客観的評価指標を初めて確立し、同じ話者の行動に対して異なる文脈において、多様で現実的で時間的に整合した顔の反応を生成できることを示している。

ABSTRACT

According to the Stimulus Organism Response (SOR) theory, all human behavioral reactions are stimulated by context, where people will process the received stimulus and produce an appropriate reaction. This implies that in a specific context for a given input stimulus, a person can react differently according to their internal state and other contextual factors. Analogously, in dyadic interactions, humans communicate using verbal and nonverbal cues, where a broad spectrum of listeners' non-verbal reactions might be appropriate for responding to a specific speaker behaviour. There already exists a body of work that investigated the problem of automatically generating an appropriate reaction for a given input. However, none attempted to automatically generate multiple appropriate reactions in the context of dyadic interactions and evaluate the appropriateness of those reactions using objective measures. This paper starts by defining the facial Multiple Appropriate Reaction Generation (fMARG) task for the first time in the literature and proposes a new set of objective evaluation metrics to evaluate the appropriateness of the generated reactions. The paper subsequently introduces a framework to predict, generate, and evaluate multiple appropriate facial reactions.

研究の動機と目的

  • 文献上、初めて複数の適切な非言語的反応を二重対話で生成するための「複数の適切な顔の反応生成(fMARG)」タスクを定義すること。
  • 文脈的および個人差を考慮した上で、単一の話者の行動に対して複数の適切な顔の反応を予測・生成・評価するフレームワークを開発すること。
  • 正確性、多様性、現実性、同期性の4つの客観的評価指標を導入し、主観的な人間評価に依存せずに生成された顔の反応の質を評価すること。
  • 類似度の閾値と実際の反応分布に基づく文脈に配慮した戦略を用いて、適切な顔の反応を自動ラベル付けすること。
  • フレームワークが、多様で現実的で時間的に同期された顔の反応を生成でき、二重対話における人間の行動様式と整合していることを検証すること。

提案手法

  • フレームワークは、文脈およびリスナー固有の状態を条件として、単一の話者の行動から複数の顔の反応(α個/入力)を深層学習ベースのモデルで生成する。
  • 類似度閾値(T)を用いて、生成された反応が適切かどうかを判断する。同じ文脈における生成された反応と実際の顔の反応との間のコサイン類似度を用いる。
  • 正確性は、データセット内に存在する少なくとも1つの実際の適切な反応と類似度が閾値を超える生成反応の割合として計算される。
  • 多様性は、顔の反応分散(FRVar)、生成反応同士のMSEの合計(S-MSE)、および条件間の多様性(FRDvs)を用いて測定され、出力の多様性を保証する。
  • 現実性は、生成された顔の反応分布と実際の顔の反応分布との間のフリードリッヒ・インセプション距離(FID)を用いて評価される。
  • 同期性は、話者の行動と生成された顔の反応の時系列データの間のタイムラグ付き相互相関(TLCC)を用いて評価され、時間的整合性を確認する。
Figure 1: Multiple appropriate reaction generation in dyadic interaction settings. The same input stimuli ( $(b(S_{1})^{t})_{1}=(b(S_{1})^{t})_{m}$ ) under different contexts ( $C_{1}\neq C_{m}$ ) of the speaker $S_{1}$ can elicit different reactions for the same listener ( $(f_{1})_{1}\neq(f_{1})_{
Figure 1: Multiple appropriate reaction generation in dyadic interaction settings. The same input stimuli ( $(b(S_{1})^{t})_{1}=(b(S_{1})^{t})_{m}$ ) under different contexts ( $C_{1}\neq C_{m}$ ) of the speaker $S_{1}$ can elicit different reactions for the same listener ( $(f_{1})_{1}\neq(f_{1})_{

実験結果

リサーチクエスチョン

  • RQ1二重対話において適切な顔の反応とは何か? また、同じ話者の行動に対して複数の適切な反応が同時に存在しうる根拠は何か?
  • RQ2文脈に配慮した方法で、生成された顔の反応の適切さ、多様性、現実性、同期性をどのように客観的に評価できるか?
  • RQ3深層学習フレームワークは、単一の話者の行動に対して、複数の明確に異なる、現実的で時間的に同期された顔の反応を生成できるか?
  • RQ4文脈的および個人差の違いは、二重対話における適切な顔の反応の生成にどのように影響を与えるか?
  • RQ5主観的な人間評価に依存せずに、複数の顔の反応生成の質を信頼性高く評価できる客観的指標は何か?

主な発見

  • 提案されたfMARGフレームワークは、入力となる話者の行動ごとに複数の明確に異なる顔の反応を生成でき、生成出力の多様性が顕著に確認された。
  • 正確性指標は、生成された反応の大部分が実際の適切な反応と類似していることを示しており、閾値に基づく類似度戦略により、適切さの評価が信頼性を持って可能であることが確認された。
  • 多様性指標(FRVar、S-MSE、FRDvs)は、入力条件内および条件間で、モデルが多様な顔の反応を生成していることを裏付けた。
  • FIDを用いた現実性スコアは、生成された顔の反応が分布的にも視覚的にも実際の人間の反応に近いことを示している。
  • 同期性指標(FRSyn)は、生成された顔の反応が話者の行動と時間的に整合していることを確認し、自然な対話ダイナミクスを反映していることを示している。
  • 本フレームワークは、客観的かつ再現可能で、将来の感情計算および人間-ロボット対話分野の研究を促進する新しいベンチマークを確立した。
Figure 2: Illustration of the proposed automatic appropriate facial reaction labelling strategy ( Sec. 3.1 ). It first represents each audio-facial speaker behaviour clip as a multi-channel time-series signal. Then, we compute the similarity between each pair of speaker behaviour time-series ( Step
Figure 2: Illustration of the proposed automatic appropriate facial reaction labelling strategy ( Sec. 3.1 ). It first represents each audio-facial speaker behaviour clip as a multi-channel time-series signal. Then, we compute the similarity between each pair of speaker behaviour time-series ( Step

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。