Skip to main content
QUICK REVIEW

[论文解读] The Zero Resource Speech Challenge 2020: Discovering discrete subword and word units

Ewan Dunbar, Julien Karadayi|arXiv (Cornell University)|Oct 12, 2020
Speech Recognition and Synthesis参考文献 28被引用 19
一句话总结

本文介绍了2020年零资源语音挑战赛,通过从原始音频中无文本监督地发现离散的子音素和词单位,推动了无监督语音表征学习的发展。该研究在语音合成质量和语音词项发现方面取得了显著进步,顶尖系统在低比特率下接近音素级单位质量,展示了在无标签条件下向人类级语音学习迈进的进展。

ABSTRACT

We present the Zero Resource Speech Challenge 2020, which aims at learning speech representations from raw audio signals without any labels. It combines the data sets and metrics from two previous benchmarks (2017 and 2019) and features two tasks which tap into two levels of speech representation. The first task is to discover low bit-rate subword representations that optimize the quality of speech synthesis; the second one is to discover word-like units from unsegmented raw speech. We present the results of the twenty submitted models and discuss the implications of the main findings for unsupervised speech learning.

研究动机与目标

  • 开发无需任何文本资源的无监督语音表征学习方法,从原始音频中发现离散的子音素和词单位。
  • 使用真实音素和词转写作为参考,从语音合成性能、单位比特率和语言准确性三个方面评估发现单位的质量。
  • 通过整合并重新开放聚焦于声学单位发现和语音词项发现的先前基准,推动零资源语音技术的最先进水平。
  • 探索是否能仅从原始音频中学习到高质量、低比特率的离散单位(类似于音素或词),以模仿人类语言习得过程。
  • 评估无监督设置下单位质量、比特率、覆盖范围和分割准确率之间的权衡。

提出的方法

  • 参赛者在英语和印度尼西亚语的无标签原始音频上训练模型,使用三个数据集:Train Voice(用于语音克隆)、Train Unit Discovery(用于与说话人无关的单位发现)和 Test(用于评估)。
  • 在语音合成方面,模型将原始音频编码为离散单位(伪文本),再通过声码器解码为波形;合成质量通过人类评估的CER、MOS和语音相似度进行评估。
  • 单位质量通过ABX错误率衡量,比特率通过测试集中不同单位向量的熵计算得出。
  • 在语音词项发现方面,模型使用聚类和动态时间规整技术在连续语音中检测词类单位,性能通过NED(归一化编辑距离)和边界检测的F-score进行评估。
  • 挑战赛采用标准化指标和基线:基于LSH的成对匹配基线,以及使用单字语法和文本转写的监督顶尖基线。
  • 所有评估均使用真实音素和词转写,通过陷阱试验和人工评估实施严格的质量控制。

实验结果

研究问题

  • RQ1仅从原始音频中能否发现可实现高质量、低比特率语音合成的离散子音素单位,且无需任何文本监督?
  • RQ2无监督模型在未分割语音中发现词类单位的程度如何?与监督基线相比,其覆盖范围和准确率表现如何?
  • RQ3在无监督语音表征学习中,单位质量、比特率和合成自然度之间的权衡关系是什么?
  • RQ4基于聚类的语音词项发现方法是否能比以往方法更好地平衡匹配质量与覆盖范围?
  • RQ5基于离散自编码器的端到端模型在单位发现和合成方面与传统流水线方法相比表现如何?

主要发现

  • 顶尖系统相比去年最佳模型,ABX错误率降低了20%,表明在相近比特率下单位质量得到提升。
  • 最佳系统实现的平均意见得分(MOS)达到4.0或以上,字符错误率(CER)低于15%,表明语音具有高度可理解性和自然度。
  • 采用自表达自编码器的系统在语音词项发现中的边界F-score达到以往最先进水平,表明分割性能出色。
  • 使用概率动态时间规整的R1和R2系统在覆盖范围与匹配质量之间实现了更好的权衡,其中R1实现高覆盖范围,R2实现低NED(归一化编辑距离)。
  • 尽管取得进展,最佳无监督离散码的细节程度仍比音素表示高一个数量级,表明与完全音素级抽象仍存在差距。
  • 监督顶尖基线系统表明,借助文本监督可实现低比特率、高质量的离散码,凸显了在无监督设置中复现此效果的挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。