Skip to main content
QUICK REVIEW

[论文解读] Identification of primary and collateral tracks in stuttered speech

Rachid Riad, Anne‐Catherine Bachoud‐Lévi|arXiv (Cornell University)|Mar 2, 2020
Stuttering Research and Treatment被引用 7
一句话总结

本文提出了一种新颖的评估框架,用于在口吃言语中进行不流畅性检测,通过克拉克(Clark)的主路径与旁路路径理论,融合临床与自然语言处理(NLP)的视角。研究构建了一个强制对齐的病理性言语数据集,并表明基于音频的片段特征(受文本片段特征启发)可显著提升帧级不流畅性检测性能,识别F1达到0.118,优于基线的声学与语调特征。

ABSTRACT

Disfluent speech has been previously addressed from two main perspectives: the clinical perspective focusing on diagnostic, and the Natural Language Processing (NLP) perspective aiming at modeling these events and detect them for downstream tasks. In addition, previous works often used different metrics depending on whether the input features are text or speech, making it difficult to compare the different contributions. Here, we introduce a new evaluation framework for disfluency detection inspired by the clinical and NLP perspective together with the theory of performance from \cite{clark1996using} which distinguishes between primary and collateral tracks. We introduce a novel forced-aligned disfluency dataset from a corpus of semi-directed interviews, and present baseline results directly comparing the performance of text-based features (word and span information) and speech-based (acoustic-prosodic information). Finally, we introduce new audio features inspired by the word-based span features. We show experimentally that using these features outperformed the baselines for speech-based predictions on the present dataset.

研究动机与目标

  • 解决口吃言语中缺乏公开、病理性、标注数据集的问题,以支持不流畅性检测研究。
  • 通过统一文本与语音不流畅性检测的评估指标,弥合自然语言处理与语音技术领域之间的差距。
  • 开发并评估可模拟文本片段特征的音频特征,以提升基于帧的不流畅性检测性能。
  • 为在正常运行的病理性言语上评估不流畅性检测系统,提供标准化、开放的基准。

提出的方法

  • 采用克拉克(1996)的主路径与旁路路径理论,将不流畅性检测定义为双路径通信过程。
  • 从成年口吃者半结构化访谈中构建新的强制对齐不流畅性数据集,并使用Praat进行标注。
  • 设计新型音频片段特征,源自基于词的片段特征,实现对言语中不流畅事件的帧级建模。
  • 采用统一的指标套件(包含精确率、召回率、F1与错误率)评估检测与识别任务,实现跨模态评估。
  • 在多种特征组合下,对比基于词的(线性核SVM)与基于帧的(声学-语调)模型。
  • 开展消融研究,以分离分析词元、片段、声学与语调特征在两种模态中的贡献。

实验结果

研究问题

  • RQ1如何在病理性言语中实现文本与语音系统在不流畅性检测上的统一评估?
  • RQ2与传统声学-语调特征相比,基于音频的片段特征在帧级不流畅性检测中能提升多少性能?
  • RQ3为何基于词的模型在不流畅性检测中优于基于帧的模型?后者缺少哪些关键特征?
  • RQ4能否通过模拟文本片段特征的音频特征,缩小文本与语音不流畅性检测之间的性能差距?

主要发现

  • 基于词的SVM模型结合词元与片段特征,达到最高的识别F1(0.721),显著优于所有基于帧的基线模型。
  • 仅使用声学特征的模型性能接近零(F1 ≤ 0.001),表明其在口吃言语中不充分。
  • 仅使用音频片段特征的模型检测召回率仅为0.063,但当与声学-语调特征结合时,达到最佳的基于帧性能,识别F1为0.118。
  • 在基于词的模型中,词元与片段特征的组合在检测任务中F1达0.772,识别任务中达0.720,凸显语言结构的重要性。
  • 消融研究显示,片段与词元特征比声学特征更具信息量,其组合性能几乎等同于完整特征集。
  • 本研究发现,基于帧的模型在极端类别不平衡下表现失败,检测与识别错误率超过100%,凸显对长序列建模方法的迫切需求。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。