[论文解读] A Comparison of Modeling Units in Sequence-to-Sequence Speech Recognition with the Transformer on Mandarin Chinese
本论文在 HKUST 数据集上使用基于 Transformer 的序列到序列模型,评估了五种建模单元——CI-音素、音节、词、子词和字符——在普通话中文自动语音识别(ASR)中的表现。基于字符的模型在未使用手工设计词典或外部语言模型的情况下,取得了 26.64% 的新 SOTA 字符错误率(CER),相比之前方法相对错误率降低了 4.8%。
The choice of modeling units is critical to automatic speech recognition (ASR) tasks. Conventional ASR systems typically choose context-dependent states (CD-states) or context-dependent phonemes (CD-phonemes) as their modeling units. However, it has been challenged by sequence-to-sequence attention-based models, which integrate an acoustic, pronunciation and language model into a single neural network. On English ASR tasks, previous attempts have already shown that the modeling unit of graphemes can outperform that of phonemes by sequence-to-sequence attention-based model. In this paper, we are concerned with modeling units on Mandarin Chinese ASR tasks using sequence-to-sequence attention-based models with the Transformer. Five modeling units are explored including context-independent phonemes (CI-phonemes), syllables, words, sub-words and characters. Experiments on HKUST datasets demonstrate that the lexicon free modeling units can outperform lexicon related modeling units in terms of character error rate (CER). Among five modeling units, character based model performs best and establishes a new state-of-the-art CER of $26.64\%$ on HKUST datasets without a hand-designed lexicon and an extra language model integration, which corresponds to a $4.8\%$ relative improvement over the existing best CER of $28.0\%$ by the joint CTC-attention based encoder-decoder network.
研究动机与目标
- 探究不同建模单元对基于序列到序列模型的普通话中文 ASR 的影响。
- 确定无需词典的建模单元(如字符、子词)是否能在端到端 ASR 中超越依赖词典的建模单元(如 CI-音素、音节)。
- 评估基于 Transformer 架构的字符级建模在 HKUST 普通话 ASR 数据集上的性能。
- 在不依赖手工整理词典或外部语言模型的前提下,建立字符错误率(CER)的新 SOTA 结果。
提出的方法
- 本研究采用基于 Transformer 的编码器-解码器架构,结合多头注意力机制,实现端到端的序列到序列语音识别。
- 评估了五种建模单元:上下文无关音素(CI-音素)、音节(带声调的汉语拼音)、词、子词(通过字节对编码生成)以及字符。
- 通过字节对编码(BPE)生成子词单元,以减少未登录词(OOV)问题并提升泛化能力。
- 模型在 HKUST 普通话语音识别数据集上进行端到端训练,通过速度扰动实现数据增强。
- 使用字符错误率(CER)评估性能,并对所有五种建模单元的结果进行对比。
- 表现最佳的模型采用字符级建模单元,在无需外部语言模型或词典集成的情况下实现了 SOTA 性能。
实验结果
研究问题
- RQ1在基于 Transformer 的序列到序列模型中,无需词典的建模单元(如字符、子词、词)是否能超越依赖词典的建模单元(如 CI-音素、音节)在普通话中文 ASR 中的表现?
- RQ2在 HKUST 普通话 ASR 数据集中,基于字符的建模是否在所有评估的建模单元中表现最佳?
- RQ3与依赖联合 CTC-注意力机制及独立语言模型的现有 SOTA 系统相比,基于字符的模型在性能上相对提升了多少?
- RQ4在 CER 和泛化能力方面,子词单元(BPE)与基于字符的建模相比表现如何?
- RQ5基于 Transformer 的模型是否能在不依赖手工设计发音词典的情况下实现 SOTA 的普通话 ASR 性能?
主要发现
- 基于字符的 Transformer 模型在 HKUST 数据集上实现了 26.64% 的新 SOTA 字符错误率(CER),优于所有其他建模单元。
- 与之前最佳结果(28.0%)相比,该字符级模型实现了 4.8% 的相对错误率降低,该结果由联合 CTC-注意力模型结合外部 RNN 语言模型取得。
- 子词模型(BPE)的 CER 为 27.26%,优于词级建模(27.42%),但略逊于字符级建模。
- 无需词典的建模单元(字符、子词、词)始终优于依赖词典的建模单元(CI-音素、音节),验证了去除手工整理词典的可行性。
- 与结合 CD 状态的混合 LSTM-HMM 系统相比,该字符级模型实现了 13.4% 的相对 CER 降低,证明了端到端 Transformer 方法的优越性。
- 结果表明,基于字符的建模特别适合与基于 Transformer 的模型结合用于普通话中文 ASR,可在无需外部语言模型或词典的情况下实现高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。