Skip to main content
QUICK REVIEW

[論文レビュー] LLM-Based Human-Robot Collaboration Framework for Manipulation Tasks

Haokun Liu, Yaonan Zhu|arXiv (Cornell University)|Aug 29, 2023
Robot Manipulation and LearningEngineering被引用数 3
ひとこと要約

本論文では、階層的タスク分解を用いて高レベルの自然言語命令を実行可能な運動シーケンスに変換するLLMベースのヒューマンロボット協調フレームワークを提案する。YOLOベースの認識、誤り補正用のDMPベースの遠隔操作、およびLLM駆動の計画を統合することで、タスクの実行可能性と一般化性能が向上し、短時間スパンのタスクでは80%を超える成功率を達成した。DMP補正により、以前は実行不能とされた動作(たとえば、ボウルをキャッチすること)も完了可能となった。

ABSTRACT

This paper presents a novel approach to enhance autonomous robotic manipulation using the Large Language Model (LLM) for logical inference, converting high-level language commands into sequences of executable motion functions. The proposed system combines the advantage of LLM with YOLO-based environmental perception to enable robots to autonomously make reasonable decisions and task planning based on the given commands. Additionally, to address the potential inaccuracies or illogical actions arising from LLM, a combination of teleoperation and Dynamic Movement Primitives (DMP) is employed for action correction. This integration aims to improve the practicality and generalizability of the LLM-based human-robot collaboration system.

研究の動機と目的

  • 家庭内操作タスクのためのロボット計画を向上させ、高レベルの自然言語命令の解釈を可能にする。
  • LLMが生成する運動シーケンスの不正確さを、人間を含むループによる遠隔操作とDMPベースの軌道学習によって是正する。
  • LLMの推論とリアルタイムの環境認識、運動補正を統合することで、システムの一般化性能と実行可能性を向上させる。
  • 長時間スパンのタスクを管理可能な短時間スパンのサブタスクに分離する階層的タスク分解戦略を開発する。
  • 自律的LLM計画と人間主導の補正の間で動的に切り替えられるように、シームレスなヒューマンロボット協調を実現する。

提案手法

  • 本システムは、タスク固有のコーパスで微調整されたGPT-2を用い、自然言語命令を実行可能な運動関数にマッピングする。
  • 階層的タスク構造により、10個以上の関数を含む長時間スパンのタスクが、10個未塔の関数を含む短時間スパンのサブタスクに分解され、個々の運動関数にマッピングされる。
  • YOLOベースの物体検出がリアルタイムかつ高精度な物体位置追跡を提供し、これがLLMの計画プロセスに統合される。
  • LLMが生成する動作が実行不能である場合、VRインターフェースを通じた遠隔操作に切り替わり、人間のデモが収集される。
  • 動的移動プリミティブ(DMPs)が、遠隔操作された軌道をモデル化・再現するために用いられ、頑健で一般化可能な運動実行を可能にする。
  • LLM計画、認識、遠隔操作、DMP補正を統合した一元的なインタラクティブループにより、ヒューマンロボット協調が実現される。
Figure 1: Framework of LLM-based task planning with enhanced HRC.
Figure 1: Framework of LLM-based task planning with enhanced HRC.

実験結果

リサーチクエスチョン

  • RQ1LLMは、ロボット操作のための実行可能な運動シーケンスに、高レベルの言語命令を効果的に分解できるか?
  • RQ2LLMが生成する運動計画が実行不能または不正確である場合、どのように是正できるか?
  • RQ3リアルタイムのYOLOベースの認識を統合することで、タスク実行の正確性はどの程度向上するか?
  • RQ4DMPベースの遠隔操作は、LLM駆動のロボット動作の実行可能性と一般化性能を向上させられるか?
  • RQ5階層的タスク分解は、長時間スパンの操作タスクの成功確率にどのような影響を与えるか?

主な発見

  • 『キャビネットの上をきれいにする』という長時間スパンのタスクでは、成功率が0.80に達し、複雑なシーケンスにおいても妥当な性能を示した。
  • 『ボウルをキャッチする』タスクは、LLMが生成する関数に依存する場合、実行可能性スコア(FSB)が0.00であった。これは、デフォルトの運動プリミティブの限界を示している。
  • DMPベースの遠隔操作補正により、『ボウルをキャッチする』タスクが正常に完了した。これは、人間を含むループによる補正の有効性を示している。
  • 『キャビネットの上をきれいにする』タスクにおける実行可能性(Exec)は0.80であり、残りの20%の失敗はLLMの関数生成におけるランダムネスに起因する。
  • 『キャッチ』『ポーズ』『オープン』といった短時間スパンのタスクは高い成功率を示し、シンプルな動作に対して本フレームワークの有効性が確認された。
  • 長時間スパンのタスクにおける誤差の蓄積は依然として課題であり、より優れた補正メカニズムと遠隔操作入力の微調整の必要性が示された。
Figure 2: Experiment data.
Figure 2: Experiment data.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。