[論文レビュー] Large Language Models as Zero-Shot Human Models for Human-Robot Interaction
本稿では、人間-ロボットインタラクション(HRI)におけるゼロショット人間モデルとしての大規模言語モデル(LLM)の使用を提案している。これにより、ファインチューニングや相互作用データが不要な状態でロボットが人間の行動を予測できる。LLMは、信頼に基づくHRIタスクにおいて、特化したモデルと同等の性能を達成した。特に、シミュレートされた食器渡し実験では、LLMベースのモデルを用いたプランナが、過剰な信頼を回避し、報酬を55%向上させた(平均報酬:-1.88 対 -4.24)。
Human models play a crucial role in human-robot interaction (HRI), enabling robots to consider the impact of their actions on people and plan their behavior accordingly. However, crafting good human models is challenging; capturing context-dependent human behavior requires significant prior knowledge and/or large amounts of interaction data, both of which are difficult to obtain. In this work, we explore the potential of large-language models (LLMs) -- which have consumed vast amounts of human-generated text data -- to act as zero-shot human models for HRI. Our experiments on three social datasets yield promising results; the LLMs are able to achieve performance comparable to purpose-built models. That said, we also discuss current limitations, such as sensitivity to prompts and spatial/numerical reasoning mishaps. Based on our findings, we demonstrate how LLM-based human models can be integrated into a social robot's planning process and applied in HRI scenarios. Specifically, we present one case study on a simulated trust-based table-clearing task and replicate past results that relied on custom models. Next, we conduct a new robot utensil-passing experiment (n = 65) where preliminary results show that planning with a LLM-based human model can achieve gains over a basic myopic plan. In summary, our results show that LLMs offer a promising (but incomplete) approach to human modeling for HRI.
研究の動機と目的
- 大規模言語モデル(LLM)が、タスク固有のデータや手作業で設定された仮定が不要な状態で、人間-ロボットインタラクション(HRI)におけるゼロショット人間モデルとして機能できるかどうかを調査すること。
- ベンチマークデータセットを用いて、LLMが社会的HRIシナリオにおける人間の高レベルな状態や行動をどの程度正確にモデル化できるかを評価すること。
- LLMベースの人間モデルをロボット計画プロセスに統合し、信頼関連のHRIタスクにおける有効性を実証すること。
- 現実世界のHRI設定において、物理的・空間的特性に関する推論に関してLLMが示す限界を評価すること。
- LLMと低レベルの物理的推論モデルを組み合わせたハイブリッドモデリングアプローチを検討し、HRIパフォーマンスの向上を図ること。
提案手法
- 文脈的な過去のヒューマンロボット相互作用のシーケンスをプロンプトとして提示することで、最先端の2つのLLM(FLAN-T5とGPT-3.5の変種)をゼロショット人間モデルとして利用した。
- 3つの社会的HRIデータセットを用いてLLMのパフォーマンスを評価し、目的に特化した機械学習モデルとの予測精度を比較した。
- LLMベースの人間モデルをシンボリックプランナに統合し、信頼に基づくテーブルクリアリングタスクのシミュレーションで行動シーケンスを生成した。
- 65名の参加者を対象に、ロボットがLLMモデルを用いて人間の干渉を予測し、それに応じて行動を調整する新しいロボット食器渡し実験を設計した。
- 2つの計画戦略を実装した:短視眼的なBasic-Planと、非ナイフの食器で意図的に失敗することで人間の信頼をキャリブレーションするLLM-Plan。
- インタラクティブな動画サーベイを用いて、実際の物理的相互作用なしにロボットの行動をシミュレートし、人間の信頼判断を収集した。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデル(LLM)は、ファインチューニングや相互作用データが不要な状態で、人間-ロボットインタラクションにおいて効果的にゼロショット人間モデルとして機能できるか?
- RQ2信頼のキャリブレーションや物の渡しといった社会的HRIタスクにおいて、LLMベースの人間モデルのパフォーマンスは、目的に特化したモデルと比べてどの程度か?
- RQ3LLMベースの人間モデルは、信頼に基づくHRIシナリオにおけるロボット計画をどの程度向上できるか?
- RQ4空間的または数値的推論を要するタスクにおいて、LLMが人間行動をモデル化する際に示す主な限界は何か?
- RQ5物理的物体の特性(例:ハンドルの形状)は人間の信頼にどのように影響するか?また、LLMはこうした知覚的要因を捉えることができるか?
主な発見
- LLMは、ゼロショットプロンプティングのみを用いて、3つのベンチマークHRIデータセットで、特化した機械学習モデルと同等の予測性能を達成した。
- 65名の参加者を対象にした食器渡し実験では、Basic-Planグループの参加者の63.6%がナイフの渡しを許可したが、LLM-Planグループではわずか28.1%にとどまった。
- LLM-Planロボットの平均報酬は-1.88と高く、Basic-Planロボットの-4.24よりも顕著に優れていた(p = 0.042)。
- ロボットがハサミで意図的に失敗したのを観察した参加者のうち90%(20名中)がナイフに対して干渉したため、信頼のキャリブレーションが効果的に実現された。
- 参加者の信頼意思決定は、ハンドルの形状といった物理的物体の特性に影響を受けており、LLMベースのモデルはこうした要因を捉えられなかった。
- LLMはプロンプトの構文に敏感であり、空間的および数値的推論に苦労しており、低レベルの物理的相互作用のモデル化に限界があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。