Skip to main content
QUICK REVIEW

[论文解读] A systematic comparison of grapheme-based vs. phoneme-based label units for encoder-decoder-attention models

Mohammad Zeineldeen, Albert Zeyer|arXiv (Cornell University)|May 19, 2020
Speech Recognition and Synthesis参考文献 49被引用 5
一句话总结

本文系统比较了在端到端自动语音识别(ASR)的编码器-解码器-注意力模型中,基于字符与基于音素的标签单元。研究发现,音素建模,特别是使用音素-BPE子词单元时,表现具有竞争力——在Switchboard数据集上略优于基于字符的模型,但在LibriSpeech数据集上略逊于基于字符的模型,凸显了子词单元和词典约束对实现最佳性能的重要性。

ABSTRACT

Following the rationale of end-to-end modeling, CTC, RNN-T or encoder-decoder-attention models for automatic speech recognition (ASR) use graphemes or grapheme-based subword units based on e.g. byte-pair encoding (BPE). The mapping from pronunciation to spelling is learned completely from data. In contrast to this, classical approaches to ASR employ secondary knowledge sources in the form of phoneme lists to define phonetic output labels and pronunciation lexica. In this work, we do a systematic comparison between grapheme- and phoneme-based output labels for an encoder-decoder-attention ASR model. We investigate the use of single phonemes as well as BPE-based phoneme groups as output labels of our model. To preserve a simplified and efficient decoder design, we also extend the phoneme set by auxiliary units to be able to distinguish homophones. Experiments performed on the Switchboard 300h and LibriSpeech benchmarks show that phoneme-based modeling is competitive to grapheme-based encoder-decoder-attention modeling.

研究动机与目标

  • 探究在编码器-解码器-注意力模型中,标签单元选择(字符 vs. 音素)对端到端ASR性能的影响。
  • 评估将子词单元(BPE)应用于音素和字符在提升ASR鲁棒性与泛化能力方面的有效性。
  • 评估辅助标签单元(如词末音素、EOW符号)在解决同音词歧义与提升解码准确率方面的作用。
  • 比较在不同语料库(特别是Switchboard,300小时与LibriSpeech,960小时)上的模型行为,以理解数据规模对标签单元性能的影响。
  • 确定音素建模是否在处理未登录词或发音变化方面优于字符建模。

提出的方法

  • 使用单个音素、音素-BPE、字符和字符-BPE作为输出标签单元,训练编码器-解码器-注意力ASR模型。
  • 对音素和字符序列分别应用字节对编码(BPE),以生成子词单元,并调整词汇表大小以实现最佳性能。
  • 引入词末符号(EOW)和词末音素符号(#)以提升同音词歧义消除与解码性能。
  • 使用词级别LSTM语言模型和先进的WFST解码器,以提升所有标签单元变体的解码准确率。
  • 在Switchboard 300小时和LibriSpeech 960小时数据集上进行实验,所有模型均以相同训练轮数和超参数进行训练。
  • 使用标准Hub5'00、Hub5'01和RT'03测试集上的WER(词错误率)评估性能,以确保不同标签类型之间的公平比较。

实验结果

研究问题

  • RQ1在编码器-解码器-注意力模型中,选择基于字符的标签单元与基于音素的标签单元如何影响ASR性能?
  • RQ2使用音素-BPE子词单元是否能提升性能,相较于单个音素?与字符-BPE相比表现如何?
  • RQ3EOW和词末音素等辅助标签单元对同音词歧义消除与整体WER的影响是什么?
  • RQ4在使用不同标签单元时,模型在较小数据集(Switchboard 300小时)与较大数据集(LibriSpeech 960小时)上的性能表现有何差异?
  • RQ5在低资源或未登录词场景下,音素建模是否能在泛化能力方面优于字符建模?

主要发现

  • 在Hub5'00 Switchboard数据集上,使用音素-BPE子词单元的音素建模达到8.7%的WER,略优于无语言模型的字符-BPE模型(10.1%)和有语言模型的字符-BPE模型(8.9%)。
  • 在单个音素模型中,引入词末符号(EOW)使WER从14.8%降至14.4%,证实其对解码的有益影响。
  • 词末音素符号(#)的性能较差(WER为15.5%),低于EOW,表明EOW在歧义消除方面比显式词末标记更有效。
  • 在LibriSpeech 960小时数据集上,使用10,000个子词的字符-BPE模型达到最低WER(干净集3.15%,其他集3.59%),优于所有音素建模变体。
  • 单个音素模型的过拟合程度显著高于子词模型,尤其在LibriSpeech数据集上,表明子词单元可提升泛化能力。
  • 使用5,000个子词的音素-BPE模型在LibriSpeech开发集-干净集上达到3.42%的WER,优于单个音素模型(5.14%),并接近字符-BPE模型的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。