Skip to main content
QUICK REVIEW

[论文解读] Extensible Grounding of Speech for Robot Instruction

Jonathan H. Connell|arXiv (Cornell University)|Jul 31, 2018
Multimodal Machine Learning Applications参考文献 13被引用 8
一句话总结

本文提出了一种可扩展的框架,用于在机器人系统中实现口语语言的语境化,使机器人能够通过人类指令学习新的物体名称和动作。通过整合感知、运动和语言语境化,并采用“被告诉即学习”的机制,该系统能够在无需预编程的情况下动态扩展其词汇量和能力,成功实现了在桌面环境中的名词和动词语境化。

ABSTRACT

Spoken language is a convenient interface for commanding a mobile robot. Yet for this to work a number of base terms must be grounded in perceptual and motor skills. We detail the language processing used on our robot ELI and explain how this grounding is performed, how it interacts with user gestures, and how it handles phenomena such as anaphora. More importantly, however, there are certain concepts which the robot cannot be preprogrammed with, such as the names of various objects in a household or the nature of specific tasks it may be requested to perform. In these cases it is vital that there exist a method for extending the grounding, essentially "learning by being told". We describe how this was successfully implemented for learning new nouns and verbs in a tabletop setting. Creating this language learning kernel may be the last explicit programming the robot ever needs - the core mechanism could eventually be used for imparting a vast amount of knowledge, much as a child learns from its parents and teachers.

研究动机与目标

  • 使机器人能够使用语境化的感知和运动技能,在真实环境中理解口语语言命令。
  • 解决机器人指令中未知或未编程概念(例如新物体或新任务)的挑战。
  • 开发一种“被告诉即学习”的机制,使机器人能够通过人类提供的示例扩展其语言语境化能力。
  • 将语音、手势和回指消解整合到一个连贯的语言理解系统中。
  • 创建一个可自我扩展的知识内核,以最小化对显式编程的需求。

提出的方法

  • 机器人使用结合语音、手势和环境感知的多模态接口,实时将语言术语与语境关联。
  • 基础术语(例如“拿起”、“移动”)通过预定义的映射关系预先与感知和运动动作关联。
  • 对于新概念,系统捕获人类提供的示范和标签,利用它们建立新的语义-物理关联。
  • 回指消解通过维护一个上下文感知的语篇模型来处理,该模型可追踪跨话语的指代对象。
  • 学习内核通过将新的名词和动词映射存储在结构化知识库中,动态扩展机器人的词汇表。
  • 系统采用混合符号-连接主义架构,以在语言语境化中平衡可解释性与适应性。

实验结果

研究问题

  • RQ1机器人如何通过人类指令动态扩展对新名词和动词的理解?
  • RQ2何种机制能够实现无需预编程的语音在感知和运动空间中的稳健语境化?
  • RQ3如何整合手势和上下文线索以提升机器人指令中的语言理解能力?
  • RQ4该系统在多轮交互中如何解决回指并保持指代一致性?
  • RQ5单一学习机制能否支持语言和动作知识的可扩展、终身获取?

主要发现

  • 机器人在桌面环境中通过直接的人类指令成功学习了新的物体名称和动作动词。
  • 系统在仅使用最少人类输入(包括手势和口头标签)的情况下,表现出对新术语的稳健语境化能力。
  • 回指消解在对话中有效维持了指代的一致性。
  • “被告诉即学习”机制使机器人能够在无需重新编程的情况下扩展其词汇量。
  • 可扩展的语境化框架支持长期、渐进式知识获取,模拟了人类的语言学习方式。
  • 该方法在未出现在初始训练集中的新物体和任务上表现出可扩展性和泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。