Skip to main content
QUICK REVIEW

[論文レビュー] Trust-Aware Decision Making for Human-Robot Collaboration: Model Learning and Planning

Min Chen, Stefanos Nikolaidis|arXiv (Cornell University)|Jan 12, 2018
Human-Automation Interaction and Safety被引用数 16
ひとこと要約

本論文では、相互作用データから学習することで、信頼を推論・影響できる信頼認識POMDPモデルを提案する。戦略的に信頼を操作することで(例:低リスクタスクで意図的に失敗することで)、ロボットは長期的なチームパフォーマンスを向上させ、シミュレーションおよび実世界のテーブル片付けタスクにおいて、短視眼的でない方策や信頼最大化方策を上回る性能を発揮する。

ABSTRACT

Trust in autonomy is essential for effective human-robot collaboration and user adoption of autonomous systems such as robot assistants. This paper introduces a computational model which integrates trust into robot decision-making. Specifically, we learn from data a partially observable Markov decision process (POMDP) with human trust as a latent variable. The trust-POMDP model provides a principled approach for the robot to (i) infer the trust of a human teammate through interaction, (ii) reason about the effect of its own actions on human trust, and (iii) choose actions that maximize team performance over the long term. We validated the model through human subject experiments on a table-clearing task in simulation (201 participants) and with a real robot (20 participants). In our studies, the robot builds human trust by manipulating low-risk objects first. Interestingly, the robot sometimes fails intentionally in order to modulate human trust and achieve the best team performance. These results show that the trust-POMDP calibrates trust to improve human-robot team performance over the long term. Further, they highlight that maximizing trust alone does not always lead to the best performance.

研究の動機と目的

  • 自律システムにおける人間の信頼の不一致という課題に対処し、これが効果的な人間-ロボット協働を妨げる要因となるのを防ぐ。
  • 信頼を部分的に観測可能なマルコフ意思決定過程(POMDP)フレームワークに潜在変数として統合することで、信頼モデリングとロボット意思決定の間のフィードバックループを閉じる。
  • 相互作用から人間の信頼レベルを推定し、ロボットの実際の能力に合った信頼を調整する行動に適応できるようにする。
  • 信頼の補正とタスク効率のバランスを取ることで、ロボットの故障が発生する状況でも長期的なチームパフォーマンスを向上させる。
  • 信頼を最大化することが常に最適ではないことを示し、戦略的な信頼調節がより良い全体的なパフォーマンスをもたらす可能性があること

提案手法

  • 信頼-POMDPモデルは、信頼を部分的に観測可能なマルコフ意思決定過程における潜在変数として表現し、ロボットが観測不能な人間の信頼レベルを推論できるようにする。
  • モデルは人間の相互作用データから信頼ダイナミクスのコンponentsを学習し、ロボットの行動に応じて信頼がどのように変化するかを捉える。
  • 人間の意思決定モデルを学習し、信頼レベルと人間の干渉行動(例:高リスク行動をロボットに実行させない)との関連を明確にする。
  • ロボットはPOMDP方策を用いて、信頼の構築とタスク進行の両方を最適化する行動を選択し、長期的なチームパフォーマンスを最大化する。
  • 故障確率が高い状況では、ロボットが低リスクの物体(例:ボトル)に対して意図的に失敗することで、過信を減らし、高価値の物体(例:グラス)での後続の失敗を防ぐ。
  • モデルは、シミュレーションで201名の参加者、実機ロボットで20名の参加者を用いたテーブル片付けタスクのデータを用いて訓練および検証された。

実験結果

リサーチクエスチョン

  • RQ1信頼が直接観測できない状況において、ロボットは人間-ロボット協働の過程で人間の信頼を体系的に推定できるか?
  • RQ2ロボットの行動が人間の信頼の変化に与える影響は何か? そして、それを計算的にモデル化できるか?
  • RQ3ロボットが人間の信頼を戦略的に調節することで、意図的な失敗を伴っても長期的なチームパフォーマンスを向上させられるか?
  • RQ4ロボットの故障が発生する可能性がある状況では、人間の信頼を最大化することが常にタスクパフォーマンスの最適化に寄与するのか?
  • RQ5信頼認識方策のパフォーマンスは、信頼を無視して行動選択を行う短視眼的方策と比べてどうなるか?

主な発見

  • 信頼-POMDP戦略は、短視眼的戦略と比較して人間の干渉率を顕著に低下させ、協働性とパフォーマンスの向上を示した。
  • ロボットは最初に低リスクの物体(例:プラスチックボトル)を処理することで信頼を構築し、高リスク行動の際の干渉を減らすことに成功した。
  • ワイングラスで故障確率が高い状況では、信頼-POMDP方策がボトルに対して意図的に失敗することで過信を軽減し、後続の失敗を防いだ。
  • パフォーマンス最大化方策は10,000回の実行で平均蓄積報酬-1.36を達成し、信頼最大化方策の-1.65(p < 0.001)を顕著に上回った。
  • ロボットの故障が発生する状況では、信頼を最大化することが最適でなかった。これは、故障発生時に信頼が急激に低下し、長期的なパフォーマンスが低下する要因となったためである。
  • モデルは、過信でもなく、低信頼でもない「信頼の補正」が、最適な人間-ロボットチームパフォーマンスに不可欠であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。