Skip to main content
QUICK REVIEW

[논문 리뷰] Unifying Large Language Model and Deep Reinforcement Learning for Human-in-Loop Interactive Socially-aware Navigation

Weizheng Wang, Obi, Ike|arXiv (Cornell University)|2024. 03. 22.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 인간이 참여하는 상호작용적 사회적 로봇 주행을 위한 하이브리드 프레임워크인 SRLM을 제안한다. 대규모 언어 모델(LLM)을 고수준 명령 해석에, 딥 강화학습(DRL) 기반 계획자로 저수준 제어를 사용하며, 행동 혼합을 안정화하기 위해 대규모 피드백 모델(LFM)을 통합함으로써 SRLM는 시뮬레이션과 실제 환경 테스트에서 모두 우수한 사회적 준수 주행 성능을 달성하였으며, 사회적 점수와 성공률 측면에서 기존 기준보다 뚜렷한 향상을 이룩하였다.

ABSTRACT

Navigating human-filled spaces is crucial for the interactive social robots to support advanced services, such as cooperative carrying, which enables service provision in complex and crowded environments while adapting behavior based on real-time human language commands or feedback. However, existing social robot navigation planners face two major challenges: managing real-time user inputs and ensuring socially compliant behaviors in unfamiliar, zero-shot environments. In response, we introduce SALM, an interactive, human-in-loop Socially-Aware navigation Large Language Model framework that dynamically integrates deep reinforcement learning (DRL) with large language model (LLM) capabilities. SALM leverages contextual semantic understanding from real-time human-robot interactions to convert high-level user commands into precise, low-level control actions. A high-level LLM module parses user input, guiding the simultaneous generation of navigation commands by both a large language navigation model (LNM) and a DRL-based navigation model (RLNM). A memory mechanism archives temporal data for continuous refinement, while a multi-step graph-of-thoughts inference-based large language feedback model adaptively fuses the strengths of both planning approaches. Experimental evaluations demonstrate that SALM not only enhances navigational precision in crowded, dynamic environments but also significantly improves system adaptability, offering tailored behaviors that align with individual user preferences and real-time feedback. More details and videos about this work are available at: https://sites.google.com/view/navi-salm.

연구 동기 및 목표

  • 동적 인간 피드백과 변동성이 큰 사용자 선호도 상황에서 실시간 적응이 가능한 사회적 로봇 주행의 과제를 해결하기 위해.
  • 고정된 파rameter를 가진 DRL 정책의 한계와, 주행 과제에서 대규모 언어 모델(LLM)의 연속적 제어 값에 대한 민감도 부족 문제를 극복하기 위해.
  • LLM의 자연어 이해 및 장기적 추론 능력과 DRL의 강력한 저수준 제어 능력을 융합하여 상호작용적이고 개인화된 주행을 실현하기 위해.
  • 사용자 선호도와 일치하는 주행 정책를 인간이 참여하는 강화학습을 통해 피드백 기반으로 개선하는 시스템을 개발하기 위해.
  • LLM와 DRL 계획자 간의 새로운 융합 메커니즘을 통해 복잡하고 다이나믹한 환경에서 주행의 안정성과 사회적 준수성을 향상시키기 위해.

제안 방법

  • SRLM는 환경 및 사회적 정보를 텍스트 임베딩으로 인코딩하여 LLM 기반의 글로벌 계획 수립을 위한 대규모 주행 모델(LNM)을 활용한다.
  • DRL 기반 계획자(RLNM)는 기준 수준의 저수준 운동 제어를 제공하여 다이나믹한 환경에서의 안정성을 확보한다.
  • 대규모 피드백 모델(LFM)은 사고의 사슬 추론을 통해 LNM 및 RLNM의 동작을 동적으로 융합하며, 상황적 맥락에 따라 융합 가중치를 조정한다.
  • 사용자 선호도와 일치하는 보상 함수를 확보하기 위해 인간 피드백에서의 강화학습(RLHF)을 사용하여 개인화를 실현한다.
  • 사회적 주행 프롬프트와 텍스트 임베딩 인코더는 실시간 센서 데이터를 LLM이 이해할 수 있는 입력으로 변환하여 동작 생성을 지원한다.
  • LLM 기반 고수준 계획 수립과 DRL 기반 실행을 통합하며, LFM을 통해 두 시스템 간의 상호 조율을 수행하여 적응형이고 사회적으로 준수하는 행동을 실현한다.

실험 결과

연구 질문

  • RQ1하이브리드 LLM-DRL 프레임워크는 복잡한 인간 환경에서 실시간으로 상호작용하는 주행을 수행하면서도 동적 사용자 명령에 적응할 수 있는가?
  • RQ2피드백 메커니즘을 통해 LLM 기반 계획자와 DRL 기반 계획자가 융합되었을 때, LLM 기반 계획자가 저수준 운동 동작을 얼마나 효과적으로 생성할 수 있는가?
  • RQ3대규모 피드백 모델(LFM)은 고정된 가중치 융합 또는 독립형 모델 대비 주행 안정성과 성능 향상에 어느 정도 기여하는가?
  • RQ4LLM과 DRL의 융합은 복잡하고 다이나믹한 상황에서 최신 기준 기준 모델보다 더 높은 사회적 준수성과 성공률을 달성할 수 있는가?
  • RQ5사용자 선호도나 작업 목적이 변경될 경우에도 실시간 사용자 피드백을 받은 후 시스템은 성능과 적응력을 유지할 수 있는가?

주요 결과

  • 아블레이션 연구에서 SRLM는 사회적 점수(SS) 90점과 성공률(SR) 90%를 기록하여 SR-RLNM 및 기타 기준 모델을 크게 앞섰다.
  • ANOVA 결과, 계획자 선택이 주행 성능에 미치는 영향이 매우 유의미한 F값 15410.139(p < 0.0001)를 보였으며, 이는 주행 성능에 미치는 영향이 크다는 것을 확인하였다.
  • LFM 기반 융합 메커니즘 덕분에 SRLM는 사용자 피드백 이후에도 높은 성능을 유지했지만, SR-RLNM는 변경된 선호도에 적응하지 못했다.
  • 궤적 시각화 결과, SR-LNM는 '상호작용 춤' 행동을 보였는데, 이는 LLM 전용 제어에서 발생하는 불안정성을 나타내었다.
  • SRLM는 다이나믹한 환경에서도 뛰어난 안정성을 확보하였으며, LNM 메모리 메커니즘이 장기적 피드백 평가 및 정책 개선을 가능하게 하였다.
  • LFM를 통한 LLM과 DRL의 융합은 실제 및 시뮬레이션 환경에서 90%의 성공률과 90의 SS를 달성하여 하이브리드 아키텍처의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.