Skip to main content
QUICK REVIEW

[论文解读] iCub: Learning Emotion Expressions using Human Reward

Nikhil Churamani, Francisco Cruz|arXiv (Cornell University)|Mar 30, 2020
Emotion and Mood Recognition参考文献 6被引用 13
一句话总结

本文提出一种基于TAMER框架的人机协同强化学习方法,用于训练iCub机器人通过面部LED灯模式学习并表达七种普适情绪。通过结合卷积神经网络(CNN)进行面部特征提取、自组织映射(SOM)进行情绪聚类,以及利用人类提供的奖励信号训练多层感知机(MLP),系统在每位用户超过100次交互后,能够学习到有意义且个性化的表情反应。

ABSTRACT

The purpose of the present study is to learn emotion expression representations for artificial agents using reward shaping mechanisms. The approach takes inspiration from the TAMER framework for training a Multilayer Perceptron (MLP) to learn to express different emotions on the iCub robot in a human-robot interaction scenario. The robot uses a combination of a Convolutional Neural Network (CNN) and a Self-Organising Map (SOM) to recognise an emotion and then learns to express the same using the MLP. The objective is to teach a robot to respond adequately to the user's perception of emotions and learn how to express different emotions.

研究动机与目标

  • 开发一种训练人工智能代理在社交互动中表达类人情绪的方法。
  • 通过人类提供的奖励信号,使机器人能够根据个体用户感知自适应调整情绪表达。
  • 探索在人机交互中情绪表达的强化学习奖励塑造方法。
  • 将基于CNN和SOM的面部情绪识别与基于MLP的动作选择相结合,实现富有表现力的机器人行为。
  • 通过人类反馈减少训练时间并提升情绪表达学习的个性化程度。

提出的方法

  • 预训练的卷积神经网络(CNN)处理来自Cohn-Kanade数据集的用户面部图像,提取面部特征表示。
  • 自组织映射(SOM)对CNN提取的特征进行聚类,形成对应于七种普适情绪及中性情绪的独立神经元单元。
  • SOM的最优匹配单元(BMU)被用作多层感知机(MLP)的输入,以预测每种可能情绪表达对应的人类奖励。
  • 人类用户根据机器人表情与自身模仿程度的接近程度,提供范围为[-2, 2]的标量奖励。
  • MLP被训练以预测人类奖励,学习选择能最大化预期奖励的情绪表达动作。
  • 系统通过持续选择预测奖励最高的动作并根据反馈进行优化,实现迭代改进。

实验结果

研究问题

  • RQ1机器人能否通过人类提供的奖励信号,学习到个体用户感知为准确的情绪表达?
  • RQ2CNN、SOM与奖励塑造强化学习的结合在实现个性化情绪表达学习方面的有效性如何?
  • RQ3实现有意义的情绪表达自适应,所需的人机交互次数是多少?
  • RQ4在人机交互背景下,SOM的最优匹配单元(BMU)如何提升情绪识别与动作选择的性能?
  • RQ5TAMER框架能否有效应用于通过实时人类反馈训练社交机器人的表现性行为?

主要发现

  • 该系统成功利用iCub机器人面部LED灯模式,学习并表达了七种普适情绪——愤怒、厌恶、恐惧、快乐、悲伤、惊讶与中性情绪。
  • 初步结果显示,模型每位用户需超过100次交互才能学习到有意义且个性化的表情表达。
  • 通过计算BMU之间归一化欧氏距离得到的[-2, 2]范围内的人类奖励信号,有效引导MLP选择合适的情绪表达。
  • 将基于CNN的面部特征提取与SOM聚类相结合,实现了鲁棒的情绪状态识别,从而支持动作选择。
  • 与非奖励基方法相比,该方法显著缩短了训练时间,尽管仍需进一步优化。
  • 用户反馈表明,随着时间推移,机器人表情被感知为越来越准确,证实了人机协同学习循环的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。