Skip to main content
QUICK REVIEW

[论文解读] Introducing ECAPA-TDNN and Wav2Vec2.0 Embeddings to Stuttering Detection

Shakeel A. Sheikh, Md Sahidullah|arXiv (Cornell University)|Apr 4, 2022
Stuttering Research and Treatment被引用 4
一句话总结

本论文提出使用ECAPA-TDNN和Wav2Vec2.0嵌入进行口吃检测,利用大规模语音数据集预训练模型,以克服口吃数据有限的问题。通过融合ECAPA-TDNN说话人嵌入与Wav2Vec2.0上下文表征,尤其采用多层拼接与分数融合,相比基线模型实现了16.74%的相对准确率提升。

ABSTRACT

The adoption of advanced deep learning (DL) architecture in stuttering detection (SD) tasks is challenging due to the limited size of the available datasets. To this end, this work introduces the application of speech embeddings extracted with pre-trained deep models trained on massive audio datasets for different tasks. In particular, we explore audio representations obtained using emphasized channel attention, propagation, and aggregation-time-delay neural network (ECAPA-TDNN) and Wav2Vec2.0 model trained on VoxCeleb and LibriSpeech datasets respectively. After extracting the embeddings, we benchmark with several traditional classifiers, such as a k-nearest neighbor, Gaussian naive Bayes, and neural network, for the stuttering detection tasks. In comparison to the standard SD system trained only on the limited SEP-28k dataset, we obtain a relative improvement of 16.74% in terms of overall accuracy over baseline. Finally, we have shown that combining two embeddings and concatenating multiple layers of Wav2Vec2.0 can further improve SD performance up to 1% and 2.64% respectively.

研究动机与目标

  • 解决在训练口吃检测深度学习模型时,口吃数据集规模小且存在偏差的挑战。
  • 探索预训练语音嵌入(特别是ECAPA-TDNN和Wav2Vec2.0)在口吃检测中的可迁移性。
  • 研究通过分数融合与嵌入融合结合ECAPA-TDNN和Wav2Vec2.0嵌入对提升检测性能的影响。
  • 分析不同Wav2Vec2.0隐藏层及其拼接对捕捉不流畅语音模式的贡献。
  • 证明来自预训练模型的上下文表征与说话人级表征显著提升了对罕见口吃类型的检测能力。

提出的方法

  • 从在VoxCeleb上微调过的ECAPA-TDNN的全连接层中提取192维说话人嵌入,用于说话人验证任务。
  • 从在LibriSpeech上预训练的Wav2Vec2.0模型的多个层(L1、L7、L11)获取上下文语音表征,使用局部编码器和上下文模块。
  • 应用线性判别分析(LDA)将Wav2Vec2.0嵌入降维,以提升下游分类任务中的类别可分性。
  • 在提取的嵌入上训练并评估多种分类器——k-近邻(KNN)、朴素贝叶斯(NBC)和多层感知机(MLP)。
  • 通过结合ECAPA-TDNN和Wav2Vec2.0模型的预测概率实现分数融合,使用优化的加权参数α=0.9。
  • 通过在输入分类器前拼接ECAPA-TDNN与Wav2Vec2.0嵌入实现嵌入融合,以利用互补信息。

实验结果

研究问题

  • RQ1在SEP-28k等小规模数据集上,预训练的ECAPA-TDNN和Wav2Vec2.0嵌入是否能提升口吃检测性能?
  • RQ2Wav2Vec2.0层的选择(L1、L7、L11)如何影响检测性能?多层拼接是否能进一步提升结果?
  • RQ3与单一模型相比,ECAPA-TDNN与Wav2Vec2.0嵌入的分数融合在多大程度上提升了检测准确率?
  • RQ4通过嵌入级融合结合ECAPA-TDNN与Wav2Vec2.0嵌入是否比分数融合带来更好的性能?
  • RQ5在不同口吃类型(阻断、重复、延长、插入词、流畅)中,这些嵌入的表现如何,尤其是少数类?

主要发现

  • 使用Wav2Vec2.0嵌入并结合神经网络分类器,相比仅在SEP-28k上训练的基线系统,整体准确率实现了16.74%的相对提升。
  • 通过分数融合结合ECAPA-TDNN与Wav2Vec2.0嵌入,整体准确率达到67.26%(使用神经网络),优于单一模型。
  • 将Wav2Vec2.0的L1、L7和L11层表征拼接后,检测性能相比基线提升2.64%,尤其显著改善了阻断和延长类的识别。
  • 对Wav2Vec2.0嵌入应用LDA后,整体检测性能提升7.28%,其中阻断类提升最大(49.88%),延长类提升14.77%。
  • ECAPA-TDNN嵌入使流畅语音检测准确率相比仅使用Wav2Vec2.0提升了5.34%(KNN)、1.13%(NBC)和5.13%(NN),表明其蕴含了强说话人身份信息。
  • ECAPA-TDNN与Wav2Vec2.0嵌入的嵌入级融合实现了最高整体准确率68.35%(使用神经网络),在阻断类(+23.86%)和插入词类(+69.54%)上相比基线有显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。