Skip to main content
QUICK REVIEW

[論文レビュー] MuMMER: Socially Intelligent Human-Robot Interaction in Public Spaces

Mary Ellen Foster, Bart Craenen|arXiv (Cornell University)|Sep 15, 2019
Social Robot Interaction and HRI参考文献 29被引用数 17
ひとこと要約

MuMMERは、ロ봇オペレーティングシステム(ROS)を介して音声・視覚的認識、社会的信号処理、会話型AI、人間を考慮した運動計画を統合した、社会的に知的な自律型ロボットシステムを、公共空間における人間-ロボットインタラクションに適用する。フィンランドのショッピングモールに導入された本システムは、案内走行、クイズ、オープンエンドの対話などを含む自然でマルチモーダルなインタラクションを可能にし、リモート処理とモジュラーなコンポonent統合により、現実世界の条件下でも最小限の遅延で安定したリアルタイム性能を示した。

ABSTRACT

In the EU-funded MuMMER project, we have developed a social robot designed to interact naturally and flexibly with users in public spaces such as a shopping mall. We present the latest version of the robot system developed during the project. This system encompasses audio-visual sensing, social signal processing, conversational interaction, perspective taking, geometric reasoning, and motion planning. It successfully combines all these components in an overarching framework using the Robot Operating System (ROS) and has been deployed to a shopping mall in Finland interacting with customers. In this paper, we describe the system components, their interplay, and the resulting robot behaviours and scenarios provided at the shopping mall.

研究の動機と目的

  • ショッピングモールのようなオープンでダイナミックな環境において、一般の利用者と自然で柔軟なインタラクションを可能にする社会的に知的なロボットの開発を目的とする。
  • 音声・視覚的認識、社会的信号処理、会話型AI、運動計画といった複数のAIコンponentsをROSを用いて統合し、統一的でリアルタイムなシステムを構築することを目的とする。
  • 長期間にわたる未訓練ユーザーとのインタラクションを含め、騒音が多く予測不能な公共環境における実世界での展開を評価することを目的とする。
  • チャット、クイズ、ルート案内といったマルチモーダルなインタラクションモードを実現し、文脈に応じた適応的で状況に配慮した行動を可能とすることを目的とする。
  • 長期間の展開とユーザースタディを通じて、実際の公共空間における自律的で社会的に適切なロボット行動の実現可能性を示すこと

提案手法

  • 本システムは、コンvolutional Pose Machines(CPM)とOpenHeadPoseを用いて、リアルタイムでの人物検出、頭部姿勢推定、視覚的トラッキングを正確に実現する。
  • カラーフィーチャーと顔特徴を用いたパーティクルフィルタベースの頭部姿勢トラッカーにより、フレーム間での個体再識別が可能であり、識別マッチングにはOpenFace埋め込みが使用される。
  • 4チャネルの音声入力を処理するマルチタスク深層ニューラルネットワークが、音声/非音声検出と音源局所化を同時に行い、騒音環境下での強固な音声トラッキングを実現する。
  • 音声と視覚的注目を統合するため、検出された音声をロボットを向いている人物と関連付ける。頭部姿勢を視覚的注目方向の代理指標として用いる。
  • 会話システムは、Alana NLUを用い、フィンランド語版ではGoogle Translateを用いてフィンランド語-英語翻訳を実行するが、英語版では完全なNLUパイプラインを採用する。フィンランド語版では、堅牢性を確保するためテンプレートベースの応答が採用された。
  • タスク実行は、チャット、クイズ、案内といったインタラクションモードを重ねて管理する中央仲裁モジュールにより調整され、ユーザー入力と文脈に基づいて行動を適応的に変更する。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてロボットは、騒音が多く変動が激しい公共環境(例:ショッピングモール)において、未訓練のユーザーと継続的かつ社会的に適切なインタラクションを維持できるか?
  • RQ2音声・視覚的認識、社会的信号処理、会話型AIのどの組み合わせが、リアルタイムで自然なマルチモーダルな人間-ロボットインタラクションを可能にするか?
  • RQ3チャット、クイズ、案内といった異なるインタラクションモード間を効果的に切り替える際、文脈を維持し、ユーザーの関与を保つにはどうすればよいか?
  • RQ4ルート案内中の指差し行動や人間を考慮したナビゲーションを実現するにあたり、視点の取り替え( perspective-taking )と幾何的推論が果たす役割は何か?
  • RQ5モジュラーでROSベースのアーキテクチャは、リアルタイムでの深層学習コンポーネント統合をどのように実現し、実世界の展開において低遅延を維持できるか?

主な発見

  • MuMMERシステムは、3か月にわたりショッピングモールに導入され、実世界の騒音環境下でも未訓練のユーザーと持続的かつリアルタイムのインタラクションを実現した。
  • CPMベースの人物検出とOpenHeadPoseの統合により、部分的遮蔽が生じてもフレーム間での頭部姿勢トラッキングと個体再識別が正確に実現された。
  • 音声処理のためのマルチタスクニューラルネットワークは、騒音の激しいモール環境下でも強固な音源局所化と音声検出を達成した。合成データおよび半自動データ収集により性能が向上した。
  • 音声認識(ASR)、意味理解(NLU)、対話管理の処理をリモートサーバーにオフロードすることで、ユーザーの発話とロボットの応答の間隔を最小限に抑え、低遅延のインタラクションを実現した。
  • ロボットは、会話を維持しながら店舗への案内を実行するなど、複雑で重複するタスクを効果的に遂行した。中断に対しても適応し、指示の繰り返しを提案する機能も実装した。
  • Google Translateを用いたフィンランド語-英語翻訳により、多言語展開が可能となったが、性能上の制限により、フィンランド語版では簡素化されたテンプレートベースの応答システムが採用され、堅牢性が確保された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。