QUICK REVIEW
[论文解读] On Laughter and Speech-Laugh, Based on Observations of Child-Robot Interaction
Anton Batliner, Stefan Steidl|arXiv (Cornell University)|Aug 30, 2019
Digital Communication and Language被引用 7
一句话总结
本研究利用FAU Aibo情感语料库,探究儿童与机器人互动中自发笑声及言语笑声的句法、对话及声学特性。研究结果表明,笑声在对话中起到组织作用,且在声学上具有显著特征,特征选择识别出调制与频谱动态是自动检测的关键判别因子。
ABSTRACT
In this article, we study laughter found in child-robot interaction where it had not been prompted intentionally. Different types of laughter and speech-laugh are annotated and processed. In a descriptive part, we report on the position of laughter and speech-laugh in syntax and dialogue structure, and on communicative functions. In a second part, we report on automatic classification performance and on acoustic characteristics, based on extensive feature selection procedures.
研究动机与目标
- 探究在未被提示的情况下,自发笑声在儿童与机器人互动中的作用及其声学特征。
- 利用声学特征与特征选择方法,自动分类笑声与言语笑声。
- 考察笑声在自然互动中的句法与对话位置及其交际功能。
- 识别能够区分笑声与言语、以及笑声与言语笑声亚型的声学特征。
提出的方法
- 使用FAU Aibo情感语料库,该语料库为51名10至13岁儿童与机器人(Aibo)通过Wizard-of-Oz设置进行的自发德语对话数据集。
- 对笑声与言语笑声进行标注,包括情绪状态、句法边界及交际功能,如标点与强调功能。
- 应用基于相关性的特征子集选择(CFS)方法,识别在三个分类层级(词级、回合级、整体)中相关的声学特征。
- 提取低层级声学描述符(如梅尔频率倒谱系数、频谱滚降、能量分布、音位概率),并推导出调制与分布函数。
- 基于所选特征使用机器学习对笑声进行分类,比较在词级、回合级与整体检测任务中的性能表现。
- 分析回合级检测中的频谱通量调制,强调笑声期间频谱动态的变化。
实验结果
研究问题
- RQ1在儿童与机器人互动中,笑声在句法与对话结构中的位置如何?
- RQ2在自发的儿童与机器人互动中,笑声与言语笑声的交际功能是什么?
- RQ3哪些声学特征最能区分笑声与言语,以及笑声与言语笑声之间?
- RQ4利用特征选择与声学建模进行笑声与言语笑声自动分类的效率如何?
- RQ5信号调制与频谱分布如何在区分笑声与言语中发挥作用?
主要发现
- 语料中仅有0.4%为笑声实例,表明其发生频率较低,但数据具有高度自然性。
- 言语笑声始终避免出现在句法内部位置,表明其在句法位置上存在强烈约束。
- 笑声在对话中常发挥‘标点’功能,用以标记回合或任务边界。
- 特征选择识别出第四梅尔频率倒谱系数的调制、音位概率以及频谱能量分布为区分笑声的关键判别特征。
- 频谱通量调制是回合级笑声检测的重要特征,表明其具有独特的频谱动态变化。
- 自动分类在回合级检测中表现良好,但在细粒度亚型区分方面仍具挑战性,尤其在同一主类别内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。