Skip to main content
QUICK REVIEW

[论文解读] Dialogue Shaping: Empowering Agents through NPC Interaction

Wei Zhou, Xiangyu Peng|arXiv (Cornell University)|Jul 28, 2023
Topic Modeling被引用 4
一句话总结

本文提出对话塑造(Dialogue Shaping)框架,利用大语言模型(LLMs)与文字类游戏中的非玩家角色(NPCs)对话,提取关键游戏知识,并将其转化为知识图谱,以通过故事塑造(Story Shaping)加速强化学习(RL)智能体训练。与基线智能体相比,该方法将RL收敛时间减少80%以上,智能体在约10,000步内达到最优策略,而基线智能体则需约90,000步。

ABSTRACT

One major challenge in reinforcement learning (RL) is the large amount of steps for the RL agent needs to converge in the training process and learn the optimal policy, especially in text-based game environments where the action space is extensive. However, non-player characters (NPCs) sometimes hold some key information about the game, which can potentially help to train RL agents faster. Thus, this paper explores how to interact and converse with NPC agents to get the key information using large language models (LLMs), as well as incorporate this information to speed up RL agent's training using knowledge graphs (KGs) and Story Shaping.

研究动机与目标

  • 为解决强化学习(RL)智能体在文字类游戏中因动作空间庞大和稀疏奖励而导致的训练收敛缓慢问题。
  • 探究与NPC进行对话交互是否能有效提取可操作的游戏知识,以更高效地引导RL智能体。
  • 通过知识图谱和故事塑造,将LLM生成的知识整合到RL训练中,以加速策略学习。
  • 评估基于对话的信息检索方法是否能提升RL智能体在文字冒险环境中的性能和样本效率。

提出的方法

  • 使用微调后的LLM作为对话智能体,与文字类游戏中的NPC互动,通过结构化问题提取与游戏相关知识。
  • 从LLM的对话响应中构建目标知识图谱(KG),筛选出以'你'为主语的代理中心动作(即目标前置条件)。
  • 应用故事塑造,基于智能体内部知识图谱与目标知识图谱之间的重叠程度,为RL智能体提供辅助奖励信号。
  • 使用KGA2C智能体,结合环境提供的稀疏奖励与基于知识图谱的奖励信号,指导策略学习。
  • 使用LIGHT框架创建具有明确胜利条件和结构化游戏状态的定制文字冒险游戏。
  • 通过在100,000次训练步长中定期间隔评估50场测试对的平均得分,来衡量性能表现。

实验结果

研究问题

  • RQ1LLM驱动的NPC对话是否能可靠地提取关键游戏知识,从而加速RL智能体训练?
  • RQ2对NPC对话内容进行知识图谱表示,在引导RL智能体走向最优策略方面有多有效?
  • RQ3通过LLM生成的知识图谱实施故事塑造,能在多大程度上减少RL收敛所需的训练步数?
  • RQ4基于对话的知识检索方法是否在样本效率和性能一致性方面优于标准RL智能体?

主要发现

  • 在游戏1中,采用LLM生成知识图谱的对话塑造智能体在约10,000次训练步内收敛至最优策略,而基线智能体则需约90,000次步长。
  • 在所有训练步长中,对话塑造智能体的平均测试得分始终优于基线,且标准差范围无重叠。
  • 该方法将所需训练步数减少80%以上,显著提升了样本效率。
  • LLM对话智能体成功检索到准确的游戏信息,包括物体依赖关系和目标前置条件,且在使用结构化问题模板时幻觉现象极少。
  • 从对话中生成的目标知识图谱提供了可靠且有效的辅助奖励信号,有效引导RL智能体走向最优策略。
  • 该框架在多个文字类游戏中表现出鲁棒性,所有评估环境中均实现了稳定的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。