Skip to main content
QUICK REVIEW

[论文解读] Leveraging neural representations for facilitating access to untranscribed speech from endangered languages.

Nay San, Martijn Bartelds|arXiv (Cornell University)|Mar 26, 2021
Speech Recognition and Synthesis参考文献 8被引用 4
一句话总结

本文提出利用预训练的英语 wav2vec 2.0 表示来提升低资源濒危语言中的查询示例语音词检测(QbE-STD)性能。通过从预训练模型的中间层提取特征,该方法在梅尔频率倒谱系数和瓶颈特征等传统特征基础上实现了 56–86% 的相对性能提升,且在与英语语音学上更接近的语言中提升效果更显著。

ABSTRACT

For languages with insufficient resources to train speech recognition systems, query-by-example spoken term detection (QbE-STD) offers a way of accessing an untranscribed speech corpus by helping identify regions where spoken query terms occur. Yet retrieval performance can be poor when the query and corpus are spoken by different speakers and produced in different recording conditions. Using data selected from a variety of speakers and recording conditions from 7 Australian Aboriginal languages and a regional variety of Dutch, all of which are endangered or vulnerable, we evaluated whether QbE-STD performance on these languages could be improved by leveraging representations extracted from the pre-trained English wav2vec 2.0 model. Compared to the use of Mel-frequency cepstral coefficients and bottleneck features, we find that representations from the middle layers of the wav2vec 2.0 Transformer offer large gains in task performance (between 56% and 86%). While features extracted using the pre-trained English model yielded improved detection on all the evaluation languages, better detection performance was associated with the evaluation language's phonological similarity to English.

研究动机与目标

  • 为解决因说话人和录音条件差异导致的低资源濒危语言中查询示例语音词检测(QbE-STD)性能低下问题。
  • 探究是否可利用高资源语言(英语)的预训练神经表示来提升低资源濒危语言中的 QbE-STD 性能。
  • 评估目标语言与英语之间的语音学相似性对迁移表示有效性的影响力。
  • 对比预训练的 wav2vec 2.0 特征与传统声学特征(如梅尔频率倒谱系数和瓶颈特征)的性能表现。

提出的方法

  • 在 7 种澳大利亚原住民语言及一种荷兰地方变体的未转录语音语料库上,微调并评估了查询示例语音词检测(QbE-STD)系统。
  • 从预训练的英语 wav2vec 2.0 模型中提取中间层表示,使用 Transformer 编码器的隐藏状态作为声学特征。
  • 将这些表示的性能与标准特征(如梅尔频率倒谱系数和瓶颈特征)进行对比。
  • 在多样化的说话人和录音条件下评估性能,以衡量对领域偏移的鲁棒性。
  • 使用标准指标(如等错误率 EER)和与基线特征相比的相对提升来衡量检测性能。
  • 分析语音学相似性与使用预训练表示后性能提升之间的相关性。

实验结果

研究问题

  • RQ1预训练的英语 wav2vec 2.0 表示是否能提升低资源濒危语言中有限转录数据下的 QbE-STD 性能?
  • RQ2在与英语语音学差异不同的语言中,迁移表示的性能表现如何变化?
  • RQ3预训练模型的中间层特征在 QbE-STD 中是否显著优于传统声学特征(如梅尔频率倒谱系数和瓶颈特征)?
  • RQ4使用预训练特征是否能缓解因说话人和录音条件不匹配导致的性能下降?

主要发现

  • 来自 Transformer 编码器中间层的预训练英语 wav2vec 2.0 表示在所有评估的濒危语言中均显著提升了 QbE-STD 性能。
  • 与基线特征(如梅尔频率倒谱系数和瓶颈特征)相比,相对性能提升范围为 56% 至 86%。
  • 与英语语音学上更相似的语言在使用预训练表示时表现出更大的性能提升。
  • 预训练特征在所有评估语言中均带来一致的性能提升,表明即使在低资源条件下也具有广泛的可迁移性。
  • 表现最佳的特征来自 wav2vec 2.0 模型的中间层,而非最终层或原始输入。
  • 结果表明,预训练表示能够有效弥合低资源语音检索任务中的领域差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。