Skip to main content
QUICK REVIEW

[論文レビュー] Human Social Interaction Modeling Using Temporal Deep Networks

Mohamed R. Amer, Behjat Siddiquie|arXiv (Cornell University)|May 6, 2015
Generative Adversarial Networks and Image Synthesis参考文献 45被引用数 5
ひとこと要約

本論文は、共同注目や共調といった重要な社会的相互作用述語(ESIP)を計算的にモデル化するため、独創的なハイブリッド深層学習モデル、識別的条件付き制限ボルツマンマシン(DCRBM)を提案する。49–76%の精度でESIPを同時に検出するとともに、平均二乗誤差が0.01–0.1の低レベル行動データを生成することで、データ駆動的かつ解釈可能な方法で社会的調和の行動的構成要素を解き明かす。

ABSTRACT

We present a novel approach to computational modeling of social interactions based on modeling of essential social interaction predicates (ESIPs) such as joint attention and entrainment. Based on sound social psychological theory and methodology, we collect a new "Tower Game" dataset consisting of audio-visual capture of dyadic interactions labeled with the ESIPs. We expect this dataset to provide a new avenue for research in computational social interaction modeling. We propose a novel joint Discriminative Conditional Restricted Boltzmann Machine (DCRBM) model that combines a discriminative component with the generative power of CRBMs. Such a combination enables us to uncover actionable constituents of the ESIPs in two steps. First, we train the DCRBM model on the labeled data and get accurate (76\%-49\% across various ESIPs) detection of the predicates. Second, we exploit the generative capability of DCRBMs to activate the trained model so as to generate the lower-level data corresponding to the specific ESIP that closely matches the actual training data (with mean square error 0.01-0.1 for generating 100 frames). We are thus able to decompose the ESIPs into their constituent actionable behaviors. Such a purely computational determination of how to establish an ESIP such as engagement is unprecedented.

研究の動機と目的

  • 共同注目や共調といった重要な社会的相互作用述語(ESIP)を識別・モデル化する計算フレームワークの開発。
  • 対人相互作用からの経験的マルチモーダルデータを根拠として、社会心理学と機械学習を結びつける。
  • 識別的および生成的モデリングを統合することで、ESIPを行動的構成要素に分解可能にする。
  • 計算社会的相互作用モデリングの研究を促進するため、新規のベンチマークデータセット「タワーゲームデータセット」を構築する。
  • 文化的な訓練、人間-ロボット相互作用、バーチャルリアリティへの応用を支援するため、現実的な相互作用ダイナミクスをモデル化する。

提案手法

  • 研究者らは、タワーゲーム中に発生する対人相互作用を記録するため、胸に装着したGoProとKinectセンサーを用いて新規の音声・視覚データセットを収集し、ESIPでラベル付けした。
  • 識別的分類と潜在表現の生成的モデリングを統合する新規の共同識別的条件付き制限ボルツマンマシン(DCRBM)を導入した。
  • DCRBMは、骨格、音声、注視方向などのマルチモーダル特徴を用いて、識別的目的関数に従ってESIP(例:共調、模倣)を検出するように訓練された。
  • 検出後、モデルはその生成的機能を活用して、ESIPクラスラベルに条件付けられた低レベル行動データ(例:関節位置)を合成する。
  • 生成性能は、さまざまな長さ(16–300フレーム)の生成済みシーケンスと正解シーケンスとの間の正規化平均二乗誤差(NMSE)を用いて評価した。
  • モデルは2つの設定で評価された:部分的な入力から欠落しているプレイヤーのデータを生成する場合、およびクラスラベルのみから完全な可視層データを生成する場合。

実験結果

リサーチクエスチョン

  • RQ1共同注目や共調といった重要な社会的相互作用述語(ESIP)は、マルチモーダルセンサデータからどのように計算的に検出可能か?
  • RQ2ハイブリッド深層学習モデルは、ESIPを同時に検出し、トレーニングデータと一致する現実的な低レベル行動データを生成可能か?
  • RQ3共調や模倣のような複雑な社会的述語の背後にある行動的構成要素は何か?
  • RQ4モデルは、さまざまな長さのシーケンスおよび異なる強度のESIPに対して、安定的かつ高精度に動作するか?
  • RQ5DCRBMモデルは、対人相互作用の意味的・時間的構造をどの程度正確に捉えられるか?

主な発見

  • DCRBMは、異なるESIPに対して49%~76%の検出精度を達成し、社会的相互作用述語の効果的な分類を示した。
  • 生成誤差は一貫して低く、ほとんどのESIPで正規化平均二乗誤差が0.1未満であったため、現実的な行動シーケンスの高精度な生成が可能であることが示された。
  • モデルは、各ESIPの強度レベルにかかわらず安定した性能を示し、相互作用強度の変動に対しても頑健であることが示された。
  • 長期間にわたるシーケンスでは、正解データの分散が高くなるため、想定通り誤差が増加した。
  • クラスラベルのみから完全な可視層データ(両プレイヤー分)を低誤差で生成でき、複雑な社会的ダイナミクスの生成的機能を実証した。
  • 本フレームワークにより、ESIPを行動的構成要素に完全に計算的に分解可能であることが実証され、これは計算社会科学分野でこれまでにない能力である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。