Skip to main content
QUICK REVIEW

[论文解读] On Laughter and Speech-Laugh, Based on Observations of Child-Robot Interaction

Anton Batliner, Stefan Steidl|arXiv (Cornell University)|Aug 30, 2019
Digital Communication and Language被引用 7
一句话总结

本研究利用FAU Aibo情感语料库,探究儿童与机器人互动中自发笑声及言语笑声的句法、对话及声学特性。研究结果表明,笑声在对话中起到组织作用,且在声学上具有显著特征,特征选择识别出调制与频谱动态是自动检测的关键判别因子。

ABSTRACT

In this article, we study laughter found in child-robot interaction where it had not been prompted intentionally. Different types of laughter and speech-laugh are annotated and processed. In a descriptive part, we report on the position of laughter and speech-laugh in syntax and dialogue structure, and on communicative functions. In a second part, we report on automatic classification performance and on acoustic characteristics, based on extensive feature selection procedures.

研究动机与目标

  • 探究在未被提示的情况下,自发笑声在儿童与机器人互动中的作用及其声学特征。
  • 利用声学特征与特征选择方法,自动分类笑声与言语笑声。
  • 考察笑声在自然互动中的句法与对话位置及其交际功能。
  • 识别能够区分笑声与言语、以及笑声与言语笑声亚型的声学特征。

提出的方法

  • 使用FAU Aibo情感语料库,该语料库为51名10至13岁儿童与机器人(Aibo)通过Wizard-of-Oz设置进行的自发德语对话数据集。
  • 对笑声与言语笑声进行标注,包括情绪状态、句法边界及交际功能,如标点与强调功能。
  • 应用基于相关性的特征子集选择(CFS)方法,识别在三个分类层级(词级、回合级、整体)中相关的声学特征。
  • 提取低层级声学描述符(如梅尔频率倒谱系数、频谱滚降、能量分布、音位概率),并推导出调制与分布函数。
  • 基于所选特征使用机器学习对笑声进行分类,比较在词级、回合级与整体检测任务中的性能表现。
  • 分析回合级检测中的频谱通量调制,强调笑声期间频谱动态的变化。

实验结果

研究问题

  • RQ1在儿童与机器人互动中,笑声在句法与对话结构中的位置如何?
  • RQ2在自发的儿童与机器人互动中,笑声与言语笑声的交际功能是什么?
  • RQ3哪些声学特征最能区分笑声与言语,以及笑声与言语笑声之间?
  • RQ4利用特征选择与声学建模进行笑声与言语笑声自动分类的效率如何?
  • RQ5信号调制与频谱分布如何在区分笑声与言语中发挥作用?

主要发现

  • 语料中仅有0.4%为笑声实例,表明其发生频率较低,但数据具有高度自然性。
  • 言语笑声始终避免出现在句法内部位置,表明其在句法位置上存在强烈约束。
  • 笑声在对话中常发挥‘标点’功能,用以标记回合或任务边界。
  • 特征选择识别出第四梅尔频率倒谱系数的调制、音位概率以及频谱能量分布为区分笑声的关键判别特征。
  • 频谱通量调制是回合级笑声检测的重要特征,表明其具有独特的频谱动态变化。
  • 自动分类在回合级检测中表现良好,但在细粒度亚型区分方面仍具挑战性,尤其在同一主类别内。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。