Skip to main content
QUICK REVIEW

[論文レビュー] Robots Learn Social Skills: End-to-End Learning of Co-Speech Gesture Generation for Humanoid Robots

Youngwoo Yoon, Woo-Ri Ko|arXiv (Cornell University)|Oct 30, 2018
Speech and dialogue systems被引用数 6
ひとこと要約

本論文では、TEDトークスの52時間分のスピーチトランスクリプトを用いて、人間型ロボットの共話ジェスチャーを生成するエンド・ツー・エンドのディーブラーニングモデルを提示する。モデルはエンコーダ・デコーダアーキテクチャを採用し、象徴的、比喩的、指示的、ビートといった多様で文脈に適したジェスチャーを生成し、NAOロボット上でリアルタイムに人間らしい動きを再現する。主観的評価により、ジェスチャーとスピーチの整合性および自然さが確認された。

ABSTRACT

Co-speech gestures enhance interaction experiences between humans as well as between humans and robots. Existing robots use rule-based speech-gesture association, but this requires human labor and prior knowledge of experts to be implemented. We present a learning-based co-speech gesture generation that is learned from 52 h of TED talks. The proposed end-to-end neural network model consists of an encoder for speech text understanding and a decoder to generate a sequence of gestures. The model successfully produces various gestures including iconic, metaphoric, deictic, and beat gestures. In a subjective evaluation, participants reported that the gestures were human-like and matched the speech content. We also demonstrate a co-speech gesture with a NAO robot working in real time.

研究の動機と目的

  • エキスパートが設計したルールに依存しない学習ベースの共話ジェスチャー生成手法の開発を目的とする。
  • スピーチのテキストのみを入力として用いて、人間型ロボットが多様で文脈的に適切なジェスチャーを生成できるようにすることを目的とする。
  • 物理的ロボット(NAO)上でリアルタイムのジェスチャー生成を実証し、人間・ロボット間対話の向上を図ることを目的とする。
  • 主観的人間評価による、生成ジェスチャーの自然さと内容との整合性を評価することを目的とする。

提案手法

  • モデルは、スピーチテキストを潜在表現にエンコードするエンコーダを備えたシーケンス・ツー・シーケンスニューラルネットワークを採用する。
  • トランスフォーマーに基づくデコーダが、エンコードされたスピーチを条件として、関節角度やタイミングなどのジェスチャーパラメータのシーケンスを生成する。
  • モデルは、スピーチトランスクリプトと対応する人間のジェスチャーがペairedされた52時間分のTEDトークス動画で事前学習される。
  • 象徴的、比喩的、指示的、ビートといったジェスチャー種別は、明示的なラベルなしにエンド・ツー・エンドの学習により暗黙的に学習される。
  • アーキテクチャにより、生のテキストから運動シーケンスへのエンド・ツー・エンドの学習が可能となり、手作業によるジェスチャー規則の回避が可能となる。
  • NAOロボットにモデルをデプロイすることでリアルタイム推論が達成され、スピーチとジェスチャーの同期出力が可能となった。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングモデルは、ルールベースのシステムを一切用いずに、スピーチテキストのみから多様な共話ジェスチャーを生成できるか?
  • RQ2生成ジェスチャーは、スピーチの意味的内容とどの程度一致しているか?
  • RQ3生成ジェスチャーは人間の観察者にとって自然で人間らしいと感じられるか?
  • RQ41つのエンド・ツー・エンドフレームワーク内で、象徴的、ビート、指示的などの多様なジェスチャー種別を生成できるか?
  • RQ5このアプローチを用いて、物理的人間型ロボット上でリアルタイムのジェスチャー生成が可能か?

主な発見

  • モデルは、象徴的、比喩的、指示的、ビートジェスチャーを含む広範なジェスチャー種別を、ジェスチャー分類の明示的スーパvisedなしに成功して生成した。
  • 主観的評価では、参加者が生成ジェスチャーを自然でスピーチ内容と整合的と認識した。
  • システムはNAO人間型ロボット上でリアルタイム性能を達成し、実用的デプロイの可能性を実証した。
  • モデルは多様なスピーチコンテンツに一般化でき、未学習の発話に対しても文脈的に適切なジェスチャーを生成した。
  • TEDトークスデータの活用により、本物の人間のスピーチから、豊かで社会的に意味のあるジェスチャーのパターンをモデルが学習できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。