Skip to main content
QUICK REVIEW

[论文解读] Language Grounding through Social Interactions and Curiosity-Driven Multi-Goal Learning

Nicolas Lair, Cédric Colas|arXiv (Cornell University)|Nov 8, 2019
Reinforcement Learning in Robotics参考文献 24被引用 6
一句话总结

该论文提出 LE2,一种通过内在好奇心和社会伙伴反馈自主发现并实现自然语言(NL)目标的强化学习智能体。通过从描述性反馈中学习语言条件化的奖励函数,智能体构建了自组织的课程,经过约 80,000 个训练回合,在模拟环境中逐步掌握 51 项复杂的机器人操作任务,且奖励模型准确率极高。

ABSTRACT

Autonomous reinforcement learning agents, like children, do not have access to predefined goals and reward functions. They must discover potential goals, learn their own reward functions and engage in their own learning trajectory. Children, however, benefit from exposure to language, helping to organize and mediate their thought. We propose LE2 (Language Enhanced Exploration), a learning algorithm leveraging intrinsic motivations and natural language (NL) interactions with a descriptive social partner (SP). Using NL descriptions from the SP, it can learn an NL-conditioned reward function to formulate goals for intrinsically motivated goal exploration and learn a goal-conditioned policy. By exploring, collecting descriptions from the SP and jointly learning the reward function and the policy, the agent grounds NL descriptions into real behavioral goals. From simple goals discovered early to more complex goals discovered by experimenting on simpler ones, our agent autonomously builds its own behavioral repertoire. This naturally occurring curriculum is supplemented by an active learning curriculum resulting from the agent's intrinsic motivations. Experiments are presented with a simulated robotic arm that interacts with several objects including tools.

研究动机与目标

  • 使自主智能体能够在无预定义任务或外部奖励的情况下发现目标并学习奖励函数。
  • 通过与社会伙伴的交互,将自然语言描述转化为具体的行为目标。
  • 开发一种自组织的、好奇心驱动的课程,以实现在多目标环境中的渐进式技能习得。
  • 通过内在探索联合训练目标条件化策略与语言条件化奖励函数。
  • 证明来自社会伙伴的语言反馈能够引导机器人智能体实现自主、可扩展的技能习得。

提出的方法

  • 智能体在环境中自由探索,收集轨迹,不依赖外部奖励信号。
  • 社会伙伴提供所实现行为的自然语言描述,形成包含 51 个不同目标的数据集。
  • 神经网络学习一个语言条件化的奖励函数,将自然语言描述映射为标量奖励。
  • 智能体利用内在好奇心(学习进度)引导探索,朝向信息量高的状态前进。
  • 使用学习到的奖励函数训练目标条件化策略,以实现已发现的目标。
  • 通过在收集的轨迹上进行交互式、自监督学习,联合优化奖励模型与策略。

实验结果

研究问题

  • RQ1智能体是否能够在无预定义奖励的多目标环境中,自主发现并实现自然语言目标?
  • RQ2来自社会伙伴的语言反馈在塑造智能体的内在探索与课程发展方面有多有效?
  • RQ3在机器人操作任务中,能否从语言接地的探索中自然涌现出好奇心驱动的自组织课程?
  • RQ4所学习的奖励函数性能如何随时间演变?其在多样化目标上的泛化能力如何?
  • RQ5语言条件化奖励函数在多大程度上能通过渐进式学习使智能体掌握日益复杂的任务?

主要发现

  • 智能体通过自主探索成功发现并掌握了 ArmToolsToys 环境中的全部 51 个预设目标。
  • 在约 80,000 个训练回合后,奖励模型达到近乎完美的性能(F1 分数接近 1.0),表明其在预测目标达成方面具有极高准确率。
  • 精确率与召回率指标在训练初期表现出显著的类别间差异,凸显了统一学习多样化目标表征的挑战。
  • 由于类别不平衡,整体模型指标(精确率与召回率)在早期具有误导性,掩盖了在个别目标上的较差表现。
  • 语言反馈与内在好奇心的结合,促成了一种自然的、自组织的课程,使学习过程从简单目标逐步过渡到复杂目标。
  • 智能体的学习轨迹由内在动机引导,实现了高效的数据收集与无外部监督的渐进式技能习得。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。