Skip to main content
QUICK REVIEW

[論文レビュー] Data-driven emotional body language generation for social robotics

Mina Marmpena, Fernando García|arXiv (Cornell University)|May 2, 2022
Social Robot Interaction and HRI被引用数 4
ひとこと要約

本論文では、感情的な表現をもつロボットのボディランゲージを生成するためのデータ駆動型フレームワークを提示している。このフレームワークは、条件付き変分オートエンコーダー(CVAE)を用い、感情の価値(valence)と覚醒度(arousal)のレベルを潜在空間のサンプリングによって条件づける。この手法により、手作業で設計されたものと同等に人間らしくかつ生き生きとしたアニメーションが生成され、特に高い覚醒度や極端な価値を持つ表現は注目を引き、より感情的であると評価された。

ABSTRACT

In social robotics, endowing humanoid robots with the ability to generate bodily expressions of affect can improve human-robot interaction and collaboration, since humans attribute, and perhaps subconsciously anticipate, such traces to perceive an agent as engaging, trustworthy, and socially present. Robotic emotional body language needs to be believable, nuanced and relevant to the context. We implemented a deep learning data-driven framework that learns from a few hand-designed robotic bodily expressions and can generate numerous new ones of similar believability and lifelikeness. The framework uses the Conditional Variational Autoencoder model and a sampling approach based on the geometric properties of the model's latent space to condition the generative process on targeted levels of valence and arousal. The evaluation study found that the anthropomorphism and animacy of the generated expressions are not perceived differently from the hand-designed ones, and the emotional conditioning was adequately differentiable between most levels except the pairs of neutral-positive valence and low-medium arousal. Furthermore, an exploratory analysis of the results reveals a possible impact of the conditioning on the perceived dominance of the robot, as well as on the participants' attention.

研究の動機と目的

  • 人間型ロボットにおける多様で説得力のある感情的ボディランゲージ(EBL)を生成するデータ駆動型手法を開発すること。
  • 深層学習を用いて感情的次元(価値と覚醒度)に基づき、生成されたEBLに正確な制御を可能にすること。
  • CVAEで生成されたEBLが、手作業で設計されたアニメーションと同等に人間らしく、生き生きとしており、感情的に解釈可能であるかどうかを評価すること。
  • 感情の条件づけが、人間-ロボットインタラクションにおけるユーザーの注目度と認識に与える影響を調査すること。

提案手法

  • Pepperロボットの手作業で設計されたEBLアニメーション(動きと目LEDの色の変化シーケンスを含む)の少数データセットを用いて、条件付き変分オートエンコーダー(CVAE)を訓練した。
  • 感情のトーン(肯定的、ニュートラル、否定的)を制御するため、スカラーの価値ラベルでモデルを条件づけた。
  • CVAEの潜在空間の幾何的性質を活用し、潜在空間内の半径を変化させることで、特定の覚醒度レベルを持つ新しいアニメーションをサンプリングした。
  • 望ましい覚醒度レベルを潜在空間内の特定の領域にマッピングするサンプリング戦略を採用し、多様で文脈的に適切なアニメーションを生成した。
  • ユーザーの研究を通じて、モデルの一般化能力を検証し、知覚的品質と感情的解釈可能性を評価した。
  • 順序ロジスティック回帰を用いて、感情の強さ、人間らしさ、生き生きとした感のユーザー評価を分析し、比例オッズ仮説の妥当性を検証した。

実験結果

リサーチクエスチョン

  • RQ1CVAEモデルは、説得力があり生き生きとしたと感じられる感情的ボディランゲージを生成できるか?
  • RQ2条件づけによって、生成されたEBLアニメーションにおける価値と覚醒度をどれほど効果的に制御できるか?
  • RQ3CVAEで生成されたアニメーションは、手作業で設計されたものと比較して、人間らしさと生き生きとした感において同等に評価されるか?
  • RQ4高い覚醒度または極端な価値を持つ感情表現は、ニュートラルまたは低覚醒度の表現よりもユーザーの注目をより引きつけるか?
  • RQ5ニュートラルと肯定的価値、あるいは中程度と低覚醒度のレベルの間には、知覚的差別化に限界があるか?

主な発見

  • 否定的または肯定的価値で条件づけられたアニメーションは、ニュートラル価値のものよりも感情的解釈可能性が著しく高く評価された(否定的 vs ニュートラル:p < 0.001;肯定的 vs ニュートラル:p = 0.01)。
  • 高い覚醒度のアニメーションは、中程度または低覚醒度のものよりも著しく感情的であると感じられた(高い vs 中程度:p < 0.001;高い vs 低い:p = 0.01)。
  • ニュートラルと肯定的価値、中程度と低覚醒度の間には有意差が認められず、これらのペアにおける知覚的差別化が限定的であることが示された。
  • 生成されたアニメーションは、事前および事後の両方の評価において、手作業で設計されたものと比べて人間らしさや生き生きとした感が低く評価されなかった(p > 0.05)。
  • 高い覚醒度または極端な価値を持つアニメーションは、より多くのユーザーの注目を集めたことから、強い知覚的インパクトがあることが示された。
  • すべてのモデルで比例オッズ仮説が満たされていた(p > 0.05)ことから、順序ロジスティック回帰分析の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。