Skip to main content
QUICK REVIEW

[論文レビュー] Mathematical Models of Adaptation in Human-Robot Collaboration

Stefanos Nikolaidis, Jodi Forlizzi|arXiv (Cornell University)|Jul 9, 2017
Robot Manipulation and Learning参考文献 14被引用数 20
ひとこと要約

本稿は、確率的計画を通じて相互適応をモデル化するゲーム理論的枠組みを提案し、ロボットが人間の好みを推論し、人間のロボットへの適応を考慮しながら行動を適応させる仕組みを提供する。主な貢献は、多様な状況下でのリアルタイム相互作用において、ロボットと人間の両方の適応を同時に最適化する形式的枠組みであり、チームのパフォーマンスと信頼性を向上させることを目的としている。

ABSTRACT

A robot operating in isolation needs to reason over the uncertainty in its model of the world and adapt its own actions to account for this uncertainty. Similarly, a robot interacting with people needs to reason over its uncertainty over the human internal state, as well as over how this state may change, as humans adapt to the robot. This paper summarizes our own work in this area, which depicts the different ways that probabilistic planning and game-theoretic algorithms can enable such reasoning in robotic systems that collaborate with people. We start with a general formulation of the problem as a two-player game with incomplete information. We then articulate the different assumptions within this general formulation, and we explain how these lead to exciting and diverse robot behaviors in real-time interactions with actual human subjects, in a variety of manufacturing, personal robotics and assistive care settings.

研究の動機と目的

  • リアルタイムの協働作業中に、人間の内部状態(目的、好み、適応可能性など)の不確実性をロボットが推論できるようにすること。
  • 人間の行動と意図の変化に基づいて行動を適応できる、計算的に実行可能なモデルを開発すること。
  • ロボットと人間がお互いの戦略を相手の反応に応じて調整する相互適応をモデル化することで、人間-ロボットチームのパフォーマンスを向上させること。
  • 製造、支援ケア、社会的ナビゲーションなどの現実世界の設定に展開可能な、スケーラブルな行動モデルと機械学習を計画アルゴリズムに統合すること。
  • ロボットがユーザーの自律性を損なわずに、より良いタスク実行を促すことで、パフォーマンスとユーザー信頼のバランスを取ること。

提案手法

  • 人間-ロボット協働を、両者に目的の共有があるが、人間の報酬関数に関する知識が非対称な2人対戦の確率的ゲームとして定式化する。
  • 人間の好みを未知の報酬関数として表現し、共同行動のデモとユーザー入力を用いて、確率的推論によりその関数を推定する。
  • 行動データから人間のタイプ(適応可能 vs. 非適応可能)を推定するために、クロストレーニングおよびクラスタリング技術を適用し、ロボットの適応性を向上させる。
  • バウンデッドメモリおよびベストリスポンスモデルを用いて、異なる仮定下での人間行動を近似し、動的環境におけるスケーラブルな計画を可能にする。
  • 人間の行動がロボットの行動にどのように反応して変化するかをモデル化する相互適応形式を採用し、推定された人間の適応可能性に基づいてロボットのポリシーを更新可能にする。
  • 言語的コミュニケーションと情報収集行動をポリシーに統合し、共有自律性および共同操作タスクにおけるユーザー誘導を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ロボットは、リアルタイムの協働作業中に、人間の内部状態(好み、適応可能性など)をどのようにモデル化し、それに適応できるか?
  • RQ2人間-ロボットチームにおける一方向のロボット適応と相互適応の間には、どのような計算的トレードオフがあるか?
  • RQ3人間の適応可能性をモデル化することで、固定されたロボット行動と比較して、チームパフォーマンスとユーザー信頼はどのように向上するか?
  • RQ4確率的計画とゲーム理論的アルゴリズムをどのように用いることで、多様な人間-ロボットインタラクションの状況下で効果的かつリアルタイムなロボット行動を生成できるか?
  • RQ5ロボットは、情報収集行動やコミュニケーション行動をどのように活用して、人間パートナーをより効果的なタスク実行へ誘導できるか?

主な発見

  • 相互適応は、一方向のロボット適応と比較して、人間-ロボットチームのパフォーマンスを顕著に向上させたが、実験ではユーザー信頼度も同等の水準を維持した。
  • 共有自律性タスクにおいて、ロボットが人間の適応可能性を推定できることで、適応可能なユーザーには最適な行動を誘導し、非適応可能なユーザーには従来通りの意思決定を委ねる協調性が向上した。
  • 相互適応形式は、ロボット単独の適応や適応なしの状況よりも優れた性能を示し、特に適応なしの状況では最大のパフォーマンスを達成したが、ユーザー信頼が低下していた。
  • 情報収集行動(例:ゆっくり移動する、一時停止する)が、ポリシー最適化プロセスから自然に出現し、人間の好みと適応可能性の推定を可能にした。
  • このフレームワークは、共同操作、社会的ナビゲーション、支援ケアなど多様な設定に一般化でき、堅牢性とスケーラビリティを示した。
  • 言語的コミュニケーションが形式主義に統合され、ロボットが言語を用いてユーザーを誘導することで、協調性とパフォーマンスがさらに向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。