Skip to main content
QUICK REVIEW

[论文解读] SPGISpeech: 5,000 hours of transcribed financial audio for fully formatted end-to-end speech recognition

Patrick O’Neill, Vitaly Lavrukhin|arXiv (Cornell University)|Apr 5, 2021
Speech Recognition and Synthesis参考文献 29被引用 9
一句话总结

本文介绍了 SPGISpeech,一个包含 5,000 小时英语语音转写文本的语音-文本语料库,其转写内容完整格式化,专业精准,涵盖收益电话会议内容,支持端到端神经语音转写,可直接预测完整正字法,包括大写、标点符号和专有名词大小写。在该语料库上训练的基于 Conformer 的模型,字符错误率(CER)达到 1.7,证明了端到端正字法语音识别在实际应用中是可行且高效的。

ABSTRACT

In the English speech-to-text (STT) machine learning task, acoustic models are conventionally trained on uncased Latin characters, and any necessary orthography (such as capitalization, punctuation, and denormalization of non-standard words) is imputed by separate post-processing models. This adds complexity and limits performance, as many formatting tasks benefit from semantic information present in the acoustic signal but absent in transcription. Here we propose a new STT task: end-to-end neural transcription with fully formatted text for target labels. We present baseline Conformer-based models trained on a corpus of 5,000 hours of professionally transcribed earnings calls, achieving a CER of 1.7. As a contribution to the STT research community, we release the corpus free for non-commercial use at https://datasets.kensho.com/datasets/scribe.

研究动机与目标

  • 填补公开语音识别数据集中缺乏完整正字法文本(包括标点、大写和专有名词大小写)的空白。
  • 证明端到端语音转写模型能够直接从音频学习预测完整的英语正字法,提升准确性并简化处理流程。
  • 向研究社区发布大规模、高质量的真实世界金融收益电话会议语料库,包含专业转写。
  • 展示语音中的声学线索能够支持对标点和大写等格式特征的准确预测,而这些特征在标准语音识别流程中通常会丢失。
  • 通过在目标输出为完整格式化文本(而非仅标准化转写)的语料库上训练模型,建立端到端语音识别的新基准。

提出的方法

  • SPGISpeech 语料库包含 5,000 小时的真实企业收益电话会议的电话会议录音,经人工转写,包含完整的正字法格式。
  • 该数据集包含多样化的说话人(50,000 人),涵盖不同的第一语言(L1)和第二语言(L2)口音,内容涉及商务和金融语境下的即兴与叙述性口语。
  • 基线模型使用 ESPnet 和 NeMo 框架训练,采用包含 12 个编码器块和 6 个解码器块的 Conformer 架构,每个块包含 8 个注意力头和 2048 个前馈单元。
  • 模型使用 CTC 和交叉熵损失进行训练,并采用 SpecAugment 进行数据增强,设置 2 个频率掩码和 5 个时间掩码。
  • 使用约 5,000 个词元的词汇表,覆盖数据集中所有字符:字母、数字、标点符号和特殊符号。
  • 模型推理采用贪婪解码,最终模型为 10 个表现最佳检查点的集成,以提高鲁棒性。
Figure 1: Distribution of Speakers by Global Region. Speaker distribution is estimated in a random sample according to reported region of corporate domicile.
Figure 1: Distribution of Speakers by Global Region. Speaker distribution is estimated in a random sample according to reported region of corporate domicile.

实验结果

研究问题

  • RQ1端到端语音识别模型能否直接从原始音频学习预测完整的英语正字法(包括标点、大写和专有名词大小写)?
  • RQ2语音中的声学线索在多大程度上能够支持对格式特征(通常在标准语音识别流程中后期推断)的准确预测?
  • RQ3在字符错误率和词错误率方面,端到端正字法语音识别的性能与标准标准化转写任务相比如何?
  • RQ4格式相关错误对整体模型错误的贡献有多大?其中有多少是由于无法消除的标签模糊性导致的?
  • RQ5大规模、经专业转写的现实世界金融语音语料库是否适合用于训练高精度、完整格式化的端到端语音识别系统?

主要发现

  • 在 SPGISpeech 上训练的 Conformer 模型在测试集上预测完整格式化正字法文本时,字符错误率(CER)为 1.7%。
  • 同一模型的词错误率(WER)为 5.7%,表明尽管格式预测复杂,性能依然出色。
  • 当转换为小写并简化为基本字符后,CER 降至 1.0%,表明超过一半的错误可归因于格式问题。
  • Conformer-CTC 变体在正字法任务上的 CER 为 1.8%,证实非自回归模型在端到端格式化任务中同样可实现高精度。
  • 本研究证明,声学模型可利用语调线索学习预测标点和大写等正字法特征,从而减少对后处理流程的依赖。
  • SPGISpeech 的发布提供了目前公开可获取的最大规模、完整格式化转写的语料库,为未来端到端正字法语音识别研究提供了支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。