Skip to main content
QUICK REVIEW

[论文解读] Training Keyword Spotters with Limited and Synthesized Speech Data

James Lin, Kevin Kilgour|arXiv (Cornell University)|Jan 31, 2020
Speech Recognition and Synthesis参考文献 15被引用 7
一句话总结

本文提出了一种两阶段关键词检测框架,利用预训练的语音嵌入模型,大幅减少对真实世界训练数据的需求。通过在合成语音数据上微调轻量级头部模型(这些数据通过嵌入模型提取),准确率达到了92.6%,与在超过4,000个真实样本上训练的完整模型相当,证明了在低资源关键词检测场景中,合成数据可以有效替代昂贵的真实数据。

ABSTRACT

With the rise of low power speech-enabled devices, there is a growing demand to quickly produce models for recognizing arbitrary sets of keywords. As with many machine learning tasks, one of the most challenging parts in the model creation process is obtaining a sufficient amount of training data. In this paper, we explore the effectiveness of synthesized speech data in training small, spoken term detection models of around 400k parameters. Instead of training such models directly on the audio or low level features such as MFCCs, we use a pre-trained speech embedding model trained to extract useful features for keyword spotting models. Using this speech embedding, we show that a model which detects 10 keywords when trained on only synthetic speech is equivalent to a model trained on over 500 real examples. We also show that a model without our speech embeddings would need to be trained on over 4000 real examples to reach the same accuracy.

研究动机与目标

  • 为低功耗、设备端应用中的关键词检测模型训练减轻数据收集负担。
  • 探究在训练小型高效关键词检测模型时,合成语音数据是否能有效替代真实语音数据。
  • 评估使用预训练语音嵌入模型作为特征提取器在关键词检测中的性能提升效果。
  • 确定在最小化数据需求的同时保持高准确率的最优真实与合成数据配比。
  • 实现在仅需极少真实数据的情况下,快速构建智能设备的定制化关键词检测器。

提出的方法

  • 采用两阶段模型架构:一个预训练的330k参数语音嵌入模型和一个用于关键词检测的轻量级55k参数头部模型。
  • 嵌入模型在2亿个YouTube音频片段(1亿个含关键词,1亿个不含)上进行训练,生成对任意关键词集合均适用的96维嵌入。
  • 使用基于Tacotron 2的文本到语音系统生成合成语音,以构建头部模型的训练数据。
  • 头部模型在合成或真实样本上进行微调,性能通过关键词检测准确率进行评估。
  • 消融实验比较了仅使用真实数据、仅使用合成数据以及混合真实-合成数据训练的模型,以评估数据效率。
  • 该框架通过在预训练阶段共享嵌入主干网络,实现跨多个关键词检测任务的迁移学习。

实验结果

研究问题

  • RQ1仅在合成语音上训练的关键词检测器能否达到与在大量真实数据上训练的模型相当的性能?
  • RQ2当使用预训练的嵌入模型时,需要多少真实数据才能达到在合成数据上训练的模型的性能?
  • RQ3为了在最小化数据收集量的同时保持高检测准确率,真实与合成数据的最佳组合是什么?
  • RQ4使用语音嵌入是否能显著减少训练有效关键词检测器所需的真实样本数量?
  • RQ5在合成数据上训练的轻量级头部模型能否优于在少量真实样本上训练的完整模型?

主要发现

  • 仅在合成语音数据上训练的关键词检测器达到92.6%的准确率,与在每个关键词上超过4,000个真实样本上训练的完整模型性能相当。
  • 使用语音嵌入可将真实数据需求减少90%:在每个关键词上仅使用50个真实样本微调的头部模型,其性能等同于在每个关键词上使用500个真实样本训练的完整模型。
  • 当在3,000个真实样本上训练时,使用嵌入的头部模型准确率达到95.3%,相比基线模型实现了58%的相对错误率降低。
  • 将50%的合成数据替换为真实数据,可使准确率差距减少90%,表明少量真实数据能显著提升性能。
  • 仅使用每个关键词5个真实样本时,仅在合成数据上训练的头部模型性能优于在每个关键词125个真实样本上训练的完整模型。
  • 即使完整模型参数更多,仅在合成数据上训练的头部模型性能仍持续优于在125个真实样本上训练的完整模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。