Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised Model Training for Unbounded Conversational Speech Recognition

Shane Walker, Morten W. Pedersen|arXiv (Cornell University)|May 26, 2017
Speech Recognition and Synthesis参考文献 22被引用 13
一句话总结

本文提出了一种半监督迭代框架,利用大规模未标注电话语音数据集构建高质量对话式语音识别语料库,通过基于置信度的过滤和自然语言处理启发式方法纠正转录文本并重新训练模型。该方法在客服人员语音上实现了35%的相对WER降低,在IBM Watson STT基础上实现了5%的绝对WER提升,显著提升了开放域对话式自动语音识别的性能。

ABSTRACT

For conversational large-vocabulary continuous speech recognition (LVCSR) tasks, up to about two thousand hours of audio is commonly used to train state of the art models. Collection of labeled conversational audio however, is prohibitively expensive, laborious and error-prone. Furthermore, academic corpora like Fisher English (2004) or Switchboard (1992) are inadequate to train models with sufficient accuracy in the unbounded space of conversational speech. These corpora are also timeworn due to dated acoustic telephony features and the rapid advancement of colloquial vocabulary and idiomatic speech over the last decades. Utilizing the colossal scale of our unlabeled telephony dataset, we propose a technique to construct a modern, high quality conversational speech training corpus on the order of hundreds of millions of utterances (or tens of thousands of hours) for both acoustic and language model training. We describe the data collection, selection and training, evaluating the results of our updated speech recognition system on a test corpus of 7K manually transcribed utterances. We show relative word error rate (WER) reductions of {35%, 19%} on {agent, caller} utterances over our seed model and 5% absolute WER improvements over IBM Watson STT on this conversational speech task.

研究动机与目标

  • 解决大规模词汇量连续语音识别(LVCSR)中手动转录对话语音数据稀缺且成本高昂的问题。
  • 克服Switchboard和Fisher等过时语料库的局限性,这些语料库因音频特征和词汇过时,已不再代表现代对话语音。
  • 开发一种可扩展的自动化流水线,利用半监督学习构建高质量、大规模的对话式语音语料库。
  • 通过迭代优化转录文本并重新训练声学模型和语言模型,提升在开放域、非受限自发语音上的语音识别性能。
  • 通过大规模数据采集实现对多样化说话人人口统计特征、口音、噪声环境以及不断演变的口语语言的泛化能力。

提出的方法

  • 使用种子ASR模型解码大规模未标注电话语音数据集,生成用于最小贝叶斯风险(MBR)置信度估计的词图(lattices)。
  • 通过选择最短段落中MBR置信度最低且语言模型困惑度最低的转录语音段,对转录语音进行过滤。
  • 应用自然语言处理启发式方法识别并纠正过滤数据中常见的、特有的转录错误,生成校正文本变换。
  • 使用校正后、经过后处理的文本从头开始重新训练声学模型,以提高对齐质量和模型性能。
  • 在每次迭代中,通过将校正后的唯一转录文本添加到真实转录训练集中,更新语言模型,以在后续过滤中获得更优的困惑度评分。
  • 利用AWS云基础设施扩展流水线,包括使用S3进行存储、SQS进行消息队列管理,以及使用配备GPU的P2实例实现高效再训练。

实验结果

研究问题

  • RQ1在不依赖昂贵人工转录的情况下,半监督迭代方法是否能显著降低对话式语音识别的WER?
  • RQ2基于置信度的过滤与自然语言处理启发式方法结合,在大规模场景下提升转录质量的效果如何?
  • RQ3大规模自动构建的语料库在现代对话式语音识别任务中,与传统人工精心构建的语料库(如Switchboard和Fisher)相比,性能提升程度如何?
  • RQ4声学模型和语言模型的迭代优化对整体系统性能以及在多样化语音条件下的泛化能力有何影响?
  • RQ5在基于云的分布式计算平台部署此类流水线的可扩展性和成本效益如何?

主要发现

  • 与种子模型相比,所提方法在客服人员语音上实现了35%的相对词错误率(WER)降低。
  • 在呼叫者语音上观察到19%的相对WER降低,表明在不同说话人角色中均具有效果。
  • 在相同对话式语音测试集上,系统相比IBM Watson STT实现了5%的绝对WER提升。
  • 最终语料库包含超过1100万个语音段,涵盖超过5000小时的对话语音,具有多样化的说话人人口统计特征、口音和噪声环境。
  • 使用基于AWS的分布式计算,仅用100个抢占式实例的集群,在20小时内完成了3000万个语音段的重新解码。
  • 迭代优化过程累积了改进效果,每次再训练周期均产生更准确的解码器和更干净的训练数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。