[論文レビュー] Lifelong Robot Learning with Human Assisted Language Planners
本論文では、大規模言語モデル(LLMs)が人間の支援を受ける言語計画を通じて動的に新しい6自由度(6-DoF)の操作スキルを要求・習得する、生涯にわたるロボット学習フレームワークを提案する。Neural Descriptor Fields(NDFs)を統合することで、データ効率の高いスキル学習が可能となり、LLMはリアルタイムでスキルライブラリを拡張できる。新しく習得したスキルは、ドキュメンテーション文字列(docstrings)で記述された場合、75%の成功率で将来のタスクで再利用可能である。
Large Language Models (LLMs) have been shown to act like planners that can decompose high-level instructions into a sequence of executable instructions. However, current LLM-based planners are only able to operate with a fixed set of skills. We overcome this critical limitation and present a method for using LLM-based planners to query new skills and teach robots these skills in a data and time-efficient manner for rigid object manipulation. Our system can re-use newly acquired skills for future tasks, demonstrating the potential of open world and lifelong learning. We evaluate the proposed framework on multiple tasks in simulation and the real world. Videos are available at: https://sites.google.com/mit.edu/halp-robot-learning.
研究の動機と目的
- 固定されたスキルライブラリの制限を超えて、LLMベースのロボットプランナが現実世界のシナリオで動的に新しい操作スキルを要求・学習できるようにすること。
- 特にサイドグラブやオブジェクトの積み重ねといった複雑な6-DoFの動作を学習する際のデータおよび時間の非効率性という課題に対処すること。
- 将来のタスクにおいて新たに習得したスキルを再利用できるシステムを構築し、ロボット分野におけるオープンワールドおよび生涯学習を可能にすること。
- 人間のフィードバックをスキル習得ループに統合することで、計画の正確性とタスクの成功確率を向上させつつ、継続的な人間の介入に依存するのを最小限に抑えること。
提案手法
- システムは、自然言語によるタスク記述、認識システムからのシーン記述、および既存のスキル(Python関数として)のライブラリを入力として受け取り、実行可能なコードとして計画を生成するLLMプランナを使用する。
- LLMが既存のスキルでは不十分な場合に新しいスキルを要求できる特別な「learn_skill」関数を提供し、スキル名と記述的なドキュメンテーション文字列(docstring)を返す。
- 新しいスキルはNeural Descriptor Fields(NDFs)を用いて実現され、6-DoFの剛体物体操作ポリシーを学習するためにたった5〜10回のデモで十分である。
- デモ後、新たに学習されたスキルはスキルライブラリに追加され、将来のタスクで再利用可能になる。
- LLMはスキルのドキュメンテーション文字列を用いてその適用可能性を推論することで、文脈的な根拠に基づいた計画の正確性を向上させる。
- 人間のフィードバックはタスクの成功確認とスキル習得を支援するが、システムは時間の経過とともにこのようなフィードバックへの依存度を低下させることを目的としている。

実験結果
リサーチクエスチョン
- RQ1LLMベースのプランナは、現実世界のロボット環境で動的に新しい6-DoFの操作スキルを要求・習得できるか?
- RQ2NDFの統合は、生涯学習の文脈において、データ効率的かつ迅速なスキル習得を実現するのにどの程度効果的か?
- RQ3LLMは新たに習得したスキルを将来のタスクでどの程度正しく再利用できるか。また、スキル記述の質がその再利用に与える影響はいかほどか?
- RQ4新しいスキルが導入された際のLLMベース計画の失敗モードは何か。それらは下流タスクの実行にどのような影響を及えるか?
主な発見
- 本システムは、NDFを用いてわずか5〜10回のデモで、シミュレーションおよび現実世界の環境においてLLMベースのプランナが新しい操作スキルを要求・習得することに成功した。
- 新しいスキルが名前とドキュメンテーション文字列(docstring)の両方で記述された場合、LLMは将来のタスクでそのスキルを正しく再利用する確率が75%に達した。
- ドキュメンテーション文字列が提供されない場合、成功率は50%に低下し、LLMの推論において文脈的な記述の重要性が浮き彫りになった。
- LLMはしばしば不適切な状況で新たに習得したスキルを呼び出し、わずかに異なる名前で同じスキルを再学習する誤りを頻発しており、スキルの適用可能性に関する推論の限界が示された。
- 認識システムからのシーン記述の不正確さが計画性能に顕著に影響を与え、システムの入力品質への感受性が顕在した。
- 人間のフィードバックはタスク成功の確認とスキル習得に不可欠であるが、繰り返し依存すると自律性が制限される。これにより、スケーラビリティを向上させるために、学習された成功検出器の導入が求められる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。