[论文解读] A Narration-based Reward Shaping Approach using Grounded Natural Language Commands
本文提出了一种基于叙述的奖励塑形方法,利用具身的自然语言指令来提升稀疏奖励环境(如《星际争霸II》的BuildMarines小游戏)中的深度强化学习性能。通过使用互嵌入模型(MEM)将自然语言指令和目标状态映射到共享嵌入空间,该方法实现了更快的学习速度,并能泛化到未见过的指令,优于无塑形和传统塑形基线方法。
While deep reinforcement learning techniques have led to agents that are successfully able to learn to perform a number of tasks that had been previously unlearnable, these techniques are still susceptible to the longstanding problem of reward sparsity. This is especially true for tasks such as training an agent to play StarCraft II, a real-time strategy game where reward is only given at the end of a game which is usually very long. While this problem can be addressed through reward shaping, such approaches typically require a human expert with specialized knowledge. Inspired by the vision of enabling reward shaping through the more-accessible paradigm of natural-language narration, we develop a technique that can provide the benefits of reward shaping using natural language commands. Our narration-guided RL agent projects sequences of natural-language commands into the same high-dimensional representation space as corresponding goal states. We show that we can get improved performance with our method compared to traditional reward-shaping approaches. Additionally, we demonstrate the ability of our method to generalize to unseen natural-language commands.
研究动机与目标
- 为解决深度强化学习中稀疏奖励的挑战,特别是在《星际争霸II》等复杂、长时程环境中。
- 通过自然语言叙述实现奖励塑形,使非专家用户无需掌握低级编程知识即可使用。
- 开发一种无需重新训练嵌入模型即可泛化到未见过的自然语言指令的方法。
- 评估基于自然语言的奖励塑形是否能在学习速度和最终性能上优于传统塑形方法和基线强化学习方法。
提出的方法
- 该方法使用互嵌入模型(MEM)将自然语言指令和对应的目标状态映射到共享的高维表示空间。
- 自然语言指令通过Word2Vec进行嵌入,而目标状态则通过神经网络从智能体的观测空间编码得到。
- MEM学习一个联合嵌入空间,使得语义上相似的指令和目标状态在向量空间中彼此靠近。
- 通过计算嵌入指令与当前状态嵌入之间的余弦相似度,生成塑形奖励,从而在训练过程中提供密集的中间反馈。
- 强化学习智能体在结合原始稀疏奖励的同时,利用这一辅助奖励信号进行训练,从而提升学习效率。
- 通过在强化学习训练期间对新出现的、未见过的自然语言指令测试训练好的MEM,评估其泛化能力。
实验结果
研究问题
- RQ1与传统奖励塑形和无塑形基线相比,使用具身自然语言指令的叙述式奖励塑形是否能提升学习性能?
- RQ2互嵌入模型在不重新训练的情况下,对未见过的自然语言指令的泛化能力有多强?
- RQ3当使用新语言指令时,强化学习智能体的性能会如何退化?是否仍能实现有意义的任务完成?
- RQ4替代语言表述的语义模糊性在多大程度上影响了指令-状态对齐的准确性,以及后续强化学习的学习效果?
主要发现
- 基于叙述引导的强化学习智能体在使用新指令时,平均得分达到约25–30,显著优于无塑形基线。
- 互嵌入模型成功地将未见过的自然语言指令投影到目标状态的正确流形上,证明了语义泛化能力。
- 语义模糊性较高的指令(如“选择一个工人单位”)投影精度降低,导致性能下降。
- 尽管在新指令上的表现有所下降,但叙述引导的智能体仍优于无塑形基线,表明塑形奖励仍具有残余效益。
- t-SNE可视化结果表明,大多数新指令投影在原始对应物附近,但部分偏差较大,与较低的学习效率相关。
- 该方法可泛化到多样的语言表述,表明其在复杂任务环境中具有广阔的人机交互潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。