Skip to main content
QUICK REVIEW

[論文レビュー] Multimodal Continuation-style Architectures for Human-Robot Interaction

Nikhil Krishnaswamy, James Pustejovsky|arXiv (Cornell University)|Sep 18, 2019
Speech and dialogue systems参考文献 21被引用数 6
ひとこと要約

本論文は、リアルタイムでの人間-アバター相互作用を可能にする、マルチモーダル継続渡しスタイルアーキテクチャを提案する。このアーキテクチャは、修正された非決定的スタックオートマトンを用いて、会話の文脈と状況をモデル化し、音声とジェスチャーの逐次的理解を実現する。動的アンビギュイティ解消、ジェスチャーのワンショット学習、文脈に配慮したアクション実行を支援する。主な貢献は、関数型プログラミングパターンを用いた、耐障害性の高いマルチモーダル統合とリアルタイム推論である。

ABSTRACT

We present an architecture for integrating real-time, multimodal input into a computational agent's contextual model. Using a human-avatar interaction in a virtual world, we treat aligned gesture and speech as an ensemble where content may be communicated by either modality. With a modified nondeterministic pushdown automaton architecture, the computer system: (1) consumes input incrementally using continuation-passing style until it achieves sufficient understanding the user's aim; (2) constructs and asks questions where necessary using established contextual information; and (3) maintains track of prior discourse items using multimodal cues. This type of architecture supports special cases of pushdown and finite state automata as well as integrating outputs from machine learning models. We present examples of this architecture's use in multimodal one-shot learning interactions of novel gestures and live action composition.

研究の動機と目的

  • 人間と身体を持つエージェントとの間で自然で文脈に配慮したコミュニケーションを可能にする、リアルタイムでマルチモーダルな相互作用アーキテクチャの開発。
  • 継続渡しスタイルによる逐次的推論を用いて、音声とジェスチャーの統合入力を耐障害的に解釈すること。
  • 状況に適した環境で、新しいジェスチャー(例:象徴的サイン)のワンショット学習を可能にし、アクションを実行すること。
  • マルチモーダルな手がかりと動的アンビギュイティ解消を用いて、会話の文脈を維持し、指示的表現(例:「そこに置いといて」)を解消すること。
  • 既存のロボットアーキテクチャ(例:DIARC や POMDP)と互換性のあるモジュラーなフレームワークを提供すること。

提案手法

  • 会話と文脈をモデル化するために、修正された非決定的スタックオートマトン(PDA)を用いる。スタックの記号は未完了のアクションや解釈を表す。
  • 継続渡しスタイル(CPS)を用いて、文脈的情報を逐次的に合成し、複数モodal間でリアルタイムでの型変換と関数適用を可能にする。
  • リアルタイム音声認識およびジェスチャー認識システムからの入力を統合し、VoxMLモデリング言語を介して意味的述語にマッピングする。
  • 指示的表現(例:「そこに置いといて」)のアンビギュイティ解消は、複数の候補先をスタックにプッシュし、人間の確認によって選択を決定する。
  • ジェスチャーのワンショット学習は、ジェスチャーの型(例:「カップをつかむ」)を、高階層のアクションテンプレート(例:「対象物を場所に置く」)に適合させる「型の昇格」によって実現する。
  • システムはC#で実装され、UnityゲームエンジンとVoxSimプラットフォームを用いており、仮想的で状況に配慮した環境へのデプロイを可能にする。

実験結果

リサーチクエスチョン

  • RQ1計算的エージェントは、文脈的一致性を保ちながら、リアルタイムで音声とジェスチャーのマルチモーダル入力を逐次的に理解するにはどうすればよいか?
  • RQ2継続渡しスタイルアーキテクチャは、人間-ロボット対話における指示的表現の動的アンビギュイティ解消をどのように支援するか?
  • RQ3どのようなメカニズムが、状況に配慮した環境で、新しいジェスチャーのワンショット学習を可能にし、複雑なアクションをトリガーするか?
  • RQ41つのアーキテクチャが、有限状態オートマトン、スタックオートマトン、決定的オートマトンをどのように統合的に扱えるか?
  • RQ5関数型プログラミングパターン(例:CPS)は、ソーシャルロボティクスにおけるリアルタイム推論をどのように向上させるか?

主な発見

  • 継続渡しスタイルを用いたリアルタイムで逐次的なマルチモーダル入力の解釈が成功し、動的型変換と関数適用が可能になった。
  • スタックベースのPDAモデルを用いて、複数の候補先や対象物を探索し、人間の確認によってアンビギュイティを効果的に解消した。
  • 象徴的ジェスチャー(例:「カップをつかむ」を模倣)のワンショット学習が、ジェスチャーの意味的型を高階層のアクションテンプレートに適合させることで実現され、直接実行が可能になった。
  • 設定に応じて、有限状態オートマトン、決定的PDA、非決定的PDAを統合的にモデル化できることを示し、異なる相互作用の複雑さに対応する柔軟性を示した。
  • C#を用いたUnityとVoxSimを用いた実装により、仮想環境でのリアルタイムデプロイが可能となり、音声、ジェスチャー、状況に配慮した世界モデリングの完全統合が達成された。
  • マルチモーダルな手がかりを用いて会話状態と過去の対話履歴を維持することで、文脈に配慮した質問の生成と応答が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。