Skip to main content
QUICK REVIEW

[论文解读] Unifying Large Language Model and Deep Reinforcement Learning for Human-in-Loop Interactive Socially-aware Navigation

Weizheng Wang, Obi, Ike|arXiv (Cornell University)|Mar 22, 2024
Multimodal Machine Learning Applications被引用 4
一句话总结

该论文提出SRLM,一种融合大型语言模型(LLM)与深度强化学习(DRL)的混合框架,用于人机协同的交互式社交机器人导航。通过利用LLM进行高层命令理解,结合基于DRL的规划器实现低层控制,并借助大型反馈模型(LFM)稳定动作融合,SRLM在仿真和真实世界测试中均显著提升了社交得分与成功率,展现出优越的社会合规性导航性能。

ABSTRACT

Navigating human-filled spaces is crucial for the interactive social robots to support advanced services, such as cooperative carrying, which enables service provision in complex and crowded environments while adapting behavior based on real-time human language commands or feedback. However, existing social robot navigation planners face two major challenges: managing real-time user inputs and ensuring socially compliant behaviors in unfamiliar, zero-shot environments. In response, we introduce SALM, an interactive, human-in-loop Socially-Aware navigation Large Language Model framework that dynamically integrates deep reinforcement learning (DRL) with large language model (LLM) capabilities. SALM leverages contextual semantic understanding from real-time human-robot interactions to convert high-level user commands into precise, low-level control actions. A high-level LLM module parses user input, guiding the simultaneous generation of navigation commands by both a large language navigation model (LNM) and a DRL-based navigation model (RLNM). A memory mechanism archives temporal data for continuous refinement, while a multi-step graph-of-thoughts inference-based large language feedback model adaptively fuses the strengths of both planning approaches. Experimental evaluations demonstrate that SALM not only enhances navigational precision in crowded, dynamic environments but also significantly improves system adaptability, offering tailored behaviors that align with individual user preferences and real-time feedback. More details and videos about this work are available at: https://sites.google.com/view/navi-salm.

研究动机与目标

  • 为解决在动态人类反馈与多变用户偏好下,社交机器人导航中的实时适应性挑战。
  • 克服固定参数DRL策略与LLM在导航任务中对连续控制值不敏感的局限性。
  • 统一LLM(自然语言理解与长上下文推理能力)与DRL(鲁棒的低层控制能力)的优势,实现交互式、个性化的导航。
  • 开发一种以反馈为驱动的系统,通过人机协同强化学习,使导航策略与用户偏好对齐。
  • 通过LLM与DRL规划器之间新颖的融合机制,提升复杂动态环境中导航的鲁棒性与社会合规性。

提出的方法

  • SRLM采用大型导航模型(LNM),将环境与社交信息编码为文本嵌入,用于基于LLM的全局规划。
  • 基于DRL的规划器(RLNM)提供基准质量的低层运动控制,确保在动态环境中的稳定性。
  • 大型反馈模型(LFM)通过思维链推理动态融合LNM与RLNM的动作,根据情境上下文调整融合权重。
  • 系统采用从人类反馈中强化学习(RLHF)对齐奖励函数与用户偏好,实现个性化。
  • 通过社交导航提示与文本嵌入编码器,将实时传感器数据转换为LLM可理解的输入,用于动作生成。
  • 该框架整合了LLM驱动的高层规划与DRL驱动的执行,利用LFM在两者之间进行中介,实现自适应、社会合规的行为。

实验结果

研究问题

  • RQ1混合LLM-DRL框架是否能在人群密集的人类环境中实现实时、交互式导航,同时适应动态用户指令?
  • RQ2当通过反馈机制将基于LLM的规划器与基于DRL的规划器结合时,LLM规划器在生成低层运动动作方面的有效性如何?
  • RQ3与固定权重融合或独立模型相比,大型反馈模型(LFM)在多大程度上提升了导航的稳定性和性能?
  • RQ4LLM与DRL的集成是否能在复杂动态场景中实现优于最先进基线模型的社会合规性与成功率?
  • RQ5在接收到实时用户反馈后,系统如何在任务目标或偏好发生变化时仍保持性能与适应性?

主要发现

  • 在消融研究中,SRLM实现了90分的社交得分(SS)与90%的成功率(SR),显著优于SR-RLNM及其他基线模型。
  • 方差分析结果表明,F值高达15410.139(p < 0.0001),证实规划器选择对导航性能具有决定性影响。
  • 基于LFM的融合机制使SRLM在用户反馈后仍能维持高性能,而SR-RLNM无法适应偏好变化。
  • 轨迹可视化显示,SR-LNM表现出“相互舞蹈”行为——重复的左右摆动,表明仅LLM控制存在不稳定性。
  • SRLM在动态环境中表现出强鲁棒性,LNM的记忆机制支持长期反馈评估与策略优化。
  • 通过LFM实现LLM与DRL的集成,SRLM在真实世界与仿真环境中均实现了90%的成功率与90分SS,验证了该混合架构的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。