Skip to main content
QUICK REVIEW

[论文解读] Self-Refined Large Language Model as Automated Reward Function Designer for Deep Reinforcement Learning in Robotics

Jiayang Song, Zhehua Zhou|arXiv (Cornell University)|Sep 13, 2023
Topic Modeling被引用 5
一句话总结

该论文提出了一种自修正大语言模型(LLM)框架,用于在机器人领域深度强化学习中自动化奖励函数设计。通过迭代地生成、评估并基于强化学习训练反馈优化奖励函数,该方法在多种机器人系统上的连续控制任务中,生成的奖励函数性能达到或超过人工设计的版本。

ABSTRACT

Although Deep Reinforcement Learning (DRL) has achieved notable success in numerous robotic applications, designing a high-performing reward function remains a challenging task that often requires substantial manual input. Recently, Large Language Models (LLMs) have been extensively adopted to address tasks demanding in-depth common-sense knowledge, such as reasoning and planning. Recognizing that reward function design is also inherently linked to such knowledge, LLM offers a promising potential in this context. Motivated by this, we propose in this work a novel LLM framework with a self-refinement mechanism for automated reward function design. The framework commences with the LLM formulating an initial reward function based on natural language inputs. Then, the performance of the reward function is assessed, and the results are presented back to the LLM for guiding its self-refinement process. We examine the performance of our proposed framework through a variety of continuous robotic control tasks across three diverse robotic systems. The results indicate that our LLM-designed reward functions are able to rival or even surpass manually designed reward functions, highlighting the efficacy and applicability of our approach.

研究动机与目标

  • 解决在机器人领域为深度强化学习手动设计高性能奖励函数的挑战。
  • 探索大语言模型(LLMs)是否能仅通过自然语言输入自主生成有效的奖励函数。
  • 开发一个自修正循环,基于强化学习训练反馈改进LLM生成的奖励函数。
  • 在多样化的连续控制机器人任务上评估该框架,并与人工设计的奖励函数进行性能对比。
  • 证明LLM生成的奖励函数可在极少人工干预下实现优于或相当的性能。

提出的方法

  • 该框架首先由LLM根据自然语言任务描述和可用的状态观测生成初始奖励函数。
  • 将生成的奖励函数用于训练DRL智能体,并收集和评估训练结果(如成功概率、奖励轨迹)。
  • 将评估结果——包括训练收敛性、平均奖励、成功概率和状态偏差——作为反馈回传给LLM。
  • LLM通过基于思维链提示策略的自我修正,根据反馈改进奖励函数设计质量。
  • 生成、评估与修正的循环持续进行,直至奖励函数在成功概率和奖励稳定性方面达到高性能。
  • 最终的奖励函数在多种机器人系统(如四足机器人、无人机、机械臂)的连续控制任务中进行验证。

实验结果

研究问题

  • RQ1LLM能否仅基于自然语言和状态观测描述,为机器人控制任务生成奖励函数?
  • RQ2自修正循环在多轮迭代中提升LLM生成奖励函数质量的效率如何?
  • RQ3LLM生成的奖励函数在连续控制任务中能否实现与人工设计版本相当或更优的性能?
  • RQ4来自强化学习训练的哪些反馈信号对指导LLM-based奖励函数修正最具信息量?
  • RQ5该框架在不同机器人平台和任务类型上的泛化能力如何?

主要发现

  • 自修正LLM框架成功为四足机器人生成了奖励函数,在前向奔跑任务中实现了99%的成功率,与人工设计的奖励函数性能相当。
  • 经过三轮迭代优化,LLM生成的奖励函数平均每集奖励达到894,训练在43,000步后实现收敛。
  • 最终LLM设计的奖励函数将线性速度偏差降低至0.183(归一化值),表明前向运动稳定且精确。
  • 框架性能优于早期迭代版本:第二轮迭代仅实现70%的成功率,而最终版本在目标1(前向速度)上达到99%成功率,在目标2(不跌倒)上达到100%成功率。
  • LLM生成的奖励函数在防止跌倒方面实现了100%的成功率,与人工工程基线性能一致。
  • 该方法在多种机器人系统中表现出良好的泛化能力,涵盖四足行走、无人机悬停及机器人操作任务。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。