Skip to main content
QUICK REVIEW

[论文解读] Sensorimotor Input as a Language Generalisation Tool: A Neurorobotics Model for Generation and Generalisation of Noun-Verb Combinations with Sensorimotor Inputs

Junpei Zhong, Martin Peniak|arXiv (Cornell University)|May 11, 2016
Social Robot Interaction and HRI参考文献 49被引用 12
一句话总结

本文提出一种基于多时间尺度循环神经网络(MTRNN)的神经机器人模型,通过感官运动交互实现人形机器人对名词-动词句式组合的具身化与泛化。通过在真实世界物体操作任务上进行训练,该模型学会将动词与动作、名词与物体相关联,从而借助分层的、动态组织的网络表征,实现对新组合的泛化,充分利用具身感官运动经验。

ABSTRACT

The paper presents a neurorobotics cognitive model to explain the understanding and generalisation of nouns and verbs combinations when a vocal command consisting of a verb-noun sentence is provided to a humanoid robot. This generalisation process is done via the grounding process: different objects are being interacted, and associated, with different motor behaviours, following a learning approach inspired by developmental language acquisition in infants. This cognitive model is based on Multiple Time-scale Recurrent Neural Networks (MTRNN).With the data obtained from object manipulation tasks with a humanoid robot platform, the robotic agent implemented with this model can ground the primitive embodied structure of verbs through training with verb-noun combination samples. Moreover, we show that a functional hierarchical architecture, based on MTRNN, is able to generalise and produce novel combinations of noun-verb sentences. Further analyses of the learned network dynamics and representations also demonstrate how the generalisation is possible via the exploitation of this functional hierarchical recurrent network.

研究动机与目标

  • 开发一种神经机器人认知模型,使机器人能够理解并生成基于感官运动经验的名词-动词组合。
  • 研究分层循环网络如何在机器人语言学习中支持未见名词-动词组合的泛化。
  • 探讨具身交互(尤其是动作与物体操作)在形成具身语言表征中的作用。
  • 证明MTRNN能够自组织功能性分层动态,通过感官运动输入支持语言泛化。
  • 使用大规模真实机器人交互数据集对模型进行验证,数据集包含9种物体、9种动作和6个空间位置。

提出的方法

  • 模型采用具有快速和慢速上下文层的多时间尺度循环神经网络(MTRNN),以编码感官运动序列的时间动态。
  • 训练数据由配对的语音指令(动词-名词)、视觉物体特征以及人形机器人平台对应的动作轨迹组成。
  • 通过利用动作(本体感觉反馈)与物体交互(视觉输入)之间的时序相关性,网络学习将动词-名词对进行关联。
  • 慢速上下文层捕捉长期的动作与物体表征,其功能类似于‘思想向量’,在时间上稳定语义含义。
  • 通过MTRNN的分层结构实现泛化,其中快速层编码即时动作序列,慢速层编码动词-物体关联的抽象、稳定表征。
  • 使用时间反向传播进行训练,借助GPU加速以应对深度RNN的计算需求。

实验结果

研究问题

  • RQ1基于MTRNN的神经机器人模型能否通过人形机器人中的感官运动交互学习具身化名词-动词组合?
  • RQ2MTRNN的分层结构在支持未在训练中出现的新名词-动词组合泛化方面发挥何种作用?
  • RQ3感官运动动态(尤其是本体感觉与视觉输入)在多大程度上塑造了动词与名词的表征?
  • RQ4MTRNN中的快速与慢速上下文层如何促进功能性、自组织语言表征的形成?
  • RQ5该模型能否在不进行显式微调的情况下,对大量新组合(如9种物体×9种动作×6个位置)实现泛化?

主要发现

  • MTRNN模型成功利用人形机器人的真实感官运动数据学习到名词-动词组合的具身化,实现了稳定且可解释的内部表征。
  • 该模型在未见的名词-动词组合上表现出稳健的泛化能力,涵盖9种物体、9种动作和6个空间位置,即使这些组合未出现在训练集中。
  • MTRNN的慢速上下文层形成了稳定、长期的表征,可作为‘思想向量’,编码动作与物体实例的语义特征。
  • 神经动力学分析表明,快速层与慢速层自组织为不同时间尺度的表征:快速层编码即时动作序列,慢速层编码动词与物体之间抽象且持久的关联。
  • 由于能够维持稳定、分层的表征并保留跨时间的模态特异性信息,该模型在泛化能力上优于标准RNN。
  • 结果证实,感官运动具身性——尤其是动作过程中的本体感觉反馈——在塑造支撑语言泛化的网络动力学中起着关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。