Skip to main content
QUICK REVIEW

[论文解读] Interaction Histories and Short Term Memory: Enactive Development of Turn-taking Behaviors in a Childlike Humanoid Robot

Frank Broz, Chrystopher L. Nehaniv|arXiv (Cornell University)|Feb 25, 2012
Social Robot Interaction and HRI参考文献 50被引用 9
一句话总结

本文提出了一种具身认知架构,使一个类孩童的人形机器人能够通过社会反馈(视觉注意力与同步)学习轮流行为,利用交互历史的短期记忆。该系统表明,通过短期记忆引入时间上下文可显著提升对复杂轮流序列的学习效果,使机器人能够获取、在不同行为间切换并根据实时社会线索进行适应。

ABSTRACT

In this article, an enactive architecture is described that allows a humanoid robot to learn to compose simple actions into turn-taking behaviors while playing interaction games with a human partner. The robot's action choices are reinforced by social feedback from the human in the form of visual attention and measures of behavioral synchronization. We demonstrate that the system can acquire and switch between behaviors learned through interaction based on social feedback from the human partner. The role of reinforcement based on a short term memory of the interaction is experimentally investigated. Results indicate that feedback based only on the immediate state is insufficient to learn certain turn-taking behaviors. Therefore some history of the interaction must be considered in the acquisition of turn-taking, which can be efficiently handled through the use of short term memory.

研究动机与目标

  • 开发一种具身认知架构,通过与人类的互动支持机器人社会行为的个体发展过程。
  • 研究交互历史的短期记忆如何增强人机交互中轮流行为的学习。
  • 使机器人能够根据实时社会反馈(如视觉注意力与同步)动态切换已学习的行为。
  • 建模社会反馈作为内在强化的作用,灵感源自婴儿与照护者之间的互动动态。
  • 证明仅靠即时反馈不足以习得某些轮流行为,因此必须借助短期记忆提供时间上下文。

提出的方法

  • 该系统使用交互历史架构(IHA),存储并检索感官运动经验序列,以指导行为选择。
  • 短期记忆组件保留近期的交互痕迹,使机器人能够将当前经验与先前经验进行比较,以实现动作选择。
  • 社会反馈源自人类的视觉注意力与行为同步,作为强化信号。
  • 行为选择由奖励机制引导,该机制在交互痕迹的度量空间中评估当前经验与过往经验的相似性。
  • 机器人通过强化学习习得轮流行为,成功的轮流行为会带来更高的奖励,从而实现行为强化。
  • 该系统支持交互中的反应式与主动式角色,使机器人能够根据已学习的模式主动发起或响应轮流游戏。

实验结果

研究问题

  • RQ1人形机器人能否在无预编程脚本的情况下,通过社会反馈学习轮流行为?
  • RQ2将交互历史的短期记忆纳入系统,如何影响复杂轮流行为的习得?
  • RQ3仅靠即时反馈是否足以学习轮流行为,还是时间上下文是必需的?
  • RQ4机器人能否根据不断变化的社会线索,动态切换不同的已学习轮流行为?
  • RQ5短期记忆窗口的长度在多大程度上影响学习效率与行为准确性?

主要发现

  • 引入短期记忆显著提升了机器人学习无法仅靠即时反馈习得的轮流行为的能力。
  • 实验表明,仅基于当前状态的反馈不足以习得某些轮流序列,凸显了时间上下文的必要性。
  • 该系统成功习得并根据实时社会反馈(如视觉注意力与同步)在多种轮流行为间切换。
  • 短期记忆窗口的长度对学习速度与成功率有可测量的影响,最优性能在特定记忆时长下实现。
  • 机器人通过基于与过去经验比较的选择表现出前瞻性,实现了适应性与情境敏感的行为。
  • 该架构使机器人能够作为轮流游戏的发起者,展现出受早期人类发展启发的社会能动性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。