[论文解读] Integrating Diverse Knowledge Sources for Online One-shot Learning of Novel Tasks
本文提出了一种用于具身智能体的在线一次学习框架,该框架在Soar认知架构内整合了多种知识源——人类自然语言指令、环境交互、内部搜索以及GPT-3的响应。通过动态结合这些知识源,智能体能够以极少的人工反馈实现实时推断与泛化任务策略,从而实现快速且可靠的任务学习。
Autonomous agents are able to draw on a wide variety of potential sources of task knowledge; however current approaches invariably focus on only one or two. Here we investigate the challenges and impact of exploiting diverse knowledge sources to learn online, in one-shot, new tasks for a simulated office mobile robot. The resulting agent, developed in the Soar cognitive architecture, uses the following sources of domain and task knowledge: interaction with the environment, task execution and search knowledge, human natural language instruction, and responses retrieved from a large language model (GPT-3). We explore the distinct contributions of these knowledge sources and evaluate the performance of different combinations in terms of learning correct task knowledge and human workload. Results show that an agent's online integration of diverse knowledge sources improves one-shot task learning overall, reducing human feedback needed for rapid and reliable task learning.
研究动机与目标
- 解决当前人工智能系统仅依赖一种或两种知识源进行任务学习的局限性。
- 在模拟移动机器人中,利用多种多样化知识源实现在线、一次学习新任务。
- 通过智能整合外部知识,减少对重复或详细指令的依赖,从而降低人工工作量。
- 开发可泛化的、基于状态的策略,使其可在相似任务和对象间迁移,避免对动作序列的僵化记忆。
- 探究整合大语言模型、人类输入、感知能力与内部搜索所带来的协同效应,以实现鲁棒且自适应的任务学习。
提出的方法
- 智能体使用Soar认知架构,整合实时感知、人类自然语言指令、用于动作规划的内部搜索,以及GPT-3生成的响应。
- 通过基于模板的提示方式查询GPT-3,生成潜在目标(例如:'把番茄酱放进冰箱')和动作(例如:'拿起番茄酱'),并由人类指导者进行验证。
- 智能体基于动作执行过程和事后分析学习程序性规则,例如:'若洗碗机关闭且机器人未持物,则建议执行Open(O1)'。
- 通过规则学习获得泛化的基于状态的策略,使其可应用于新物体(如金属叉)和相似任务(如清理不同餐具),实现策略迁移。
- 根据当前任务、检测到的物体、属性(如关闭、可抓取)和目标,动态选择规则,实现无需重训的自适应动作选择。
- 系统通过在任务执行过程中在线整合知识,避免预训练,确保实时适应性与最小的人工干预。
实验结果
研究问题
- RQ1整合多种多样化知识源(大语言模型、人类语言、感知、搜索)如何提升具身智能体的在线一次任务学习性能?
- RQ2各知识源(尤其是大语言模型)对降低人工工作量和提升学习可靠性所作的相对贡献是什么?
- RQ3智能体能否仅通过一次示范和多种知识源学习到泛化且可重用的策略,而非僵化记忆动作序列?
- RQ4将大语言模型响应与人类反馈相结合,如何缓解幻觉问题并提升任务执行的上下文准确性?
- RQ5在无需额外指令或学习的情况下,智能体在多大程度上能将所学策略泛化到新物体和相似任务上?
主要发现
- 整合多样化知识源显著提升了单次任务学习的性能,使智能体能够以极少人工反馈快速且可靠地掌握新任务。
- 智能体通过结合人类指令、大语言模型生成的动作、环境感知和内部搜索,成功学习了'整理厨房'任务,实现正确执行而无需重复指令。
- 智能体学习到了泛化的程序性规则(如打开、关闭、抓取、放下物体等),适用于多种物体和场景,可迁移至新实例(如金属叉)而无需重新学习。
- 基于模板的GPT-3提示方式降低了幻觉风险,人类反馈对大语言模型输出进行验证与修正,提升了可靠性与上下文准确性。
- 通过将规划与动作生成任务外推至集成知识源(尤其是大语言模型和内部搜索),系统显著减少了对详细人工输入的依赖。
- 智能体表现出鲁棒性,能够根据环境状态和目标条件选择合适动作(如先靠近再打开),即使动作无法立即执行也能做出合理决策。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。