Skip to main content
QUICK REVIEW

[論文レビュー] Unifying Large Language Model and Deep Reinforcement Learning for Human-in-Loop Interactive Socially-aware Navigation

Weizheng Wang, Obi, Ike|arXiv (Cornell University)|Mar 22, 2024
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、人間を含むインタラクティブな社会的ロボットナビゲーションのため、大規模言語モデル(LLM)と深層強化学習(DRL)を統合したハイブリッドフレームワーク、SRLMを提案する。LLMを用いて高レベルの命令を解釈し、DRLに基づくプランナで低レベルの制御を実行する一方、行動のブレンドを安定化させるために大規模フィードバックモデル(LFM)を活用することで、SRLMは、シミュレーションおよび実世界のテストの両方で、社会的適合性スコアと成功確率の面で顕著な向上を達成し、ベースラインを上回る優れたナビゲーション性能を発揮する。

ABSTRACT

Navigating human-filled spaces is crucial for the interactive social robots to support advanced services, such as cooperative carrying, which enables service provision in complex and crowded environments while adapting behavior based on real-time human language commands or feedback. However, existing social robot navigation planners face two major challenges: managing real-time user inputs and ensuring socially compliant behaviors in unfamiliar, zero-shot environments. In response, we introduce SALM, an interactive, human-in-loop Socially-Aware navigation Large Language Model framework that dynamically integrates deep reinforcement learning (DRL) with large language model (LLM) capabilities. SALM leverages contextual semantic understanding from real-time human-robot interactions to convert high-level user commands into precise, low-level control actions. A high-level LLM module parses user input, guiding the simultaneous generation of navigation commands by both a large language navigation model (LNM) and a DRL-based navigation model (RLNM). A memory mechanism archives temporal data for continuous refinement, while a multi-step graph-of-thoughts inference-based large language feedback model adaptively fuses the strengths of both planning approaches. Experimental evaluations demonstrate that SALM not only enhances navigational precision in crowded, dynamic environments but also significantly improves system adaptability, offering tailored behaviors that align with individual user preferences and real-time feedback. More details and videos about this work are available at: https://sites.google.com/view/navi-salm.

研究の動機と目的

  • 動的な人間からのフィードバックと変動しやすいユーザーの好みの下で、リアルタイムの適応が可能な社会的ロボットナビゲーションの課題に対処すること。
  • 固定パラメータのDRLポリシーの限界と、ナビゲーションタスクにおけるLLMの連続的制御値への感受性の低さを克服すること。
  • LLMの自然言語理解力および長距離推論能力の強みと、DRLの強力な低レベル制御能力を統合し、インタラクティブでパーソナライズされたナビゲーションを実現すること。
  • 人間を含む強化学習によるフィードバック駆動型システムを構築し、ナビゲーションポリシーをユーザーの好みに一致させること。
  • LLMとDRLプランナの間の新規な統合メカニズムを用いて、混雑で動的な環境におけるナビゲーションの頑健性と社会的適合性を向上させること。

提案手法

  • SRLMは、環境的および社会的情報をテキスト埋め込みに変換する大規模ナビゲーションモデル(LNM)を採用し、LLMを用いたグローバルプランニングを実現する。
  • DRLに基づくプランナ(RLNM)は、動的な環境でも安定した低レベルの運動制御を提供し、ベンチマーク水準の性能を達成する。
  • 大規模フィードバックモデル(LFM)は、状況に応じて融合重みを調整する思考の連鎖を用いて、LNMとRLNMの行動を動的にブレンドする。
  • 人間からのフィードバックによる強化学習(RLHF)を用いて報酬関数をユーザーの好みに一致させ、パーソナライズを可能にする。
  • 社会的ナビゲーションプロンプトとテキスト埋め込みエンコーダーにより、リアルタイムのセンサデータがLLMが理解可能な入力に変換され、行動生成が可能になる。
  • LLM駆動の高レベルプランニングとDRL駆動の実行を統合し、LFMが両者を調整することで、適応的で社会的適合性のある行動を実現する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドLLM-DRLフレームワークは、動的な人間環境においてリアルタイムで対話的ナビゲーションを実現できるか、かつ変化するユーザーの命令に適応できるか?
  • RQ2フィードバックメカニズムを介してLLMベースのプランナとDRLベースのプランナを統合した場合、LLMベースのプランナが低レベルの運動行動をどれほど効果的に生成できるか?
  • RQ3大規模フィードバックモデル(LFM)は、固定重みの融合や単体モデルと比較して、ナビゲーションの安定性と性能をどの程度向上させるか?
  • RQ4LLMとDRLの統合は、複雑で動的な状況において、最先端のベースラインを上回る社会的適合性と成功確率を達成できるか?
  • RQ5ユーザーのフィードバックをリアルタイムで受けると、特にタスクの目的や好みが変化した場合でも、システムは性能と適応性を維持できるか?

主な発見

  • アブレーションスタディにおいて、SRLMは社会的適合性スコア(SS)90点、成功確率(SR)90%を達成し、SR-RLNMおよび他のベースラインを顕著に上回った。
  • 分散分析(ANOVA)の結果、F値が15410.139(p < 0.0001)と極めて有意であったことから、プランナ選択がナビゲーション性能に大きな影響を与えることが確認された。
  • LFMベースの統合メカニズムにより、SRLMはユーザーのフィードバック後も高い性能を維持したが、SR-RLNMは変更された好みに適応できなかった。
  • 軌道可視化の結果、SR-LNMは「相互作用のダンス」とも呼ばれる反復的な横方向の動きを示し、LLM単体の制御における不安定性が明らかになった。
  • SRLMは動的な環境でも頑健性を示し、LNMのメモリ機構により長期的なフィードバック評価とポリシーの最適化が可能になった。
  • LFMによるLLMとDRLの統合により、90%の成功確率と90のSSが達成され、実世界およびシミュレーション環境においてもハイブリッドアーキテクチャの有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。