Skip to main content
QUICK REVIEW

[論文レビュー] Affective Faces for Goal-Driven Dyadic Communication

Scott Geng, Revant Teotia|arXiv (Cornell University)|Jan 26, 2023
Subtitles and Audiovisual MediaArts and Humanities被引用数 3
ひとこと要約

本論文は、話者の発話とリスナーの目的や性格を条件として、双方向会話におけるリスナーの社会的に適切な表情を生成するためのフレームワークを提案する。大規模言語モデル(LLM)と視覚言語モデル(VLM)を用い、人間評価および未脚本で多様な会話から構築された新規データセットによる検証により、ベースラインと比較して顕著な社会的適切性の向上を達成した。

ABSTRACT

We introduce a video framework for modeling the association between verbal and non-verbal communication during dyadic conversation. Given the input speech of a speaker, our approach retrieves a video of a listener, who has facial expressions that would be socially appropriate given the context. Our approach further allows the listener to be conditioned on their own goals, personalities, or backgrounds. Our approach models conversations through a composition of large language models and vision-language models, creating internal representations that are interpretable and controllable. To study multimodal communication, we propose a new video dataset of unscripted conversations covering diverse topics and demographics. Experiments and visualizations show our approach is able to output listeners that are significantly more socially appropriate than baselines. However, many challenges remain, and we release our dataset publicly to spur further progress. See our website for video results, data, and code: https://realtalk.cs.columbia.edu.

研究の動機と目的

  • 双方向会話における言語的および非言語的コミュニケーションの動的な相互作用、特に発話に対する表情の反応をモデル化すること。
  • リスナー固有の要因(目的、性格、背景など)を条件として用いることで、リスナーフレームワークの行動を制御すること。
  • 従来の動画生成手法が低レベルの音声または視覚特徴にのみ焦点を当てており、高レベルの意味的推論が欠落している問題に対処すること。
  • マルチモーダルで目的駆動の社会的相互作用モデリングを支援するため、新規で多様で未脚本の動画データセットを構築すること。
  • LLMが社会的文脈を効果的に推論し、視覚ベースの生成において社会的に適切な表情を導くことの有効性を示すこと。

提案手法

  • フレームワークは、話者の発話文を解釈し、リスナーフレームワーク固有の条件(例:関係の目的、性格)に基づいて適切な視覚的特徴を推論する大規模言語モデル(例:GPT-3)を用いる。
  • これらの推論された視覚的特徴をもとに、CLIPのようなVLM埋め込みを用いた動画検索システムから対応する表情の動画を検索する。
  • 話者の発話内容とリスナーフレームワークの目的の両方に条件づけることで、表情の反応に明示的な教師信号を必要とせずに感情的反応を制御できる。
  • LLMにおけるFew-shotプロンプティングを活用し、多様な社会的文脈に一般化して社会的に適切な反応を推論する。
  • リスナーフレームワークの動画生成を、視覚言語モデルの埋め込みを用いて予測された特徴と実際の動画クリップを照合する検索タスクとして扱う。
  • 時間的ダイナミクスは明示的にモデル化されておらず、予測はキーフレームレベルの表現に基づいており、予測のタイミングずれが生じる可能性がある。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは会話の社会的文脈を効果的に推論し、適切なリスナーフレームワークの表情を予測できるか?
  • RQ2リスナーフレームワークの目的や性格に条件づけることで、生成された表情の社会的適切性はどのように向上するか?
  • RQ3視覚言語モデルは、LLMが生成した特徴に基づいて、社会的に適切なリスナーフレームワークの動画をどれほど適切に検索できるか?
  • RQ4本手法は、人間の社会的期待に適合する表情を生成する点で、ベースラインモデルと比較してどのように優れているか?
  • RQ5本フレームワークの主な失敗モードは何か。また、それらはモダリティの欠落や時間的ずれとどのように関係しているか?

主な発見

  • 人間評価による確認により、本手法はLearning2Listenを含むベースラインモデルと比較して、社会的に適切なリスナーフレームワークの表情を顕著に優れて生成している。
  • 人間評価者は、本システムの予測した「社会的に正しい」リスナーフレームワークの表情を、社会的に誤った予測やLearning2Listenベースラインよりも統計的に有意に好む傾向を示した。
  • フレームワークは、性格特性や関係性のダイナミクスといったオープンワールドのリスナーフレームワークの目的に対しても、良好に一般化し、多様な状況で適切な反応を正しく推論している。
  • 失敗事例の主な原因は、顔の表情や抑揚(プロソディ)を含むマルチモーダルな話者文脈の欠落であり、トーンや意図の誤解に繋がる。
  • 時間的ずれが主な制限要因であり、たとえばジョークのクライマックスの前に笑顔を生成してしまうなど、関連する発話イベントより先にリスナーフレームワークの表情が予測されることがある。
  • 言語モデルの幻覚(特に比喩的表現や曖昧な発話)により、話者の意図について誤った推論が生じ、不適切なリスナーフレームワークの反応が生成される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。