Skip to main content
QUICK REVIEW

[论文解读] Phoneme-Based Contextualization for Cross-Lingual Speech Recognition in End-to-End Models

Ke Hu, Antoine Bruguier|arXiv (Cornell University)|Jun 21, 2019
Speech Recognition and Synthesis参考文献 22被引用 7
一句话总结

本文提出一种结合词片(wordpieces)与音素(phonemes)的混合端到端自动语音识别(ASR)模型,以提升跨语言语音识别性能,尤其针对低资源语言中的未登录词(OOV)专有名词,如外语地名。通过在音素层面进行上下文偏置(contextual biasing),利用外语音素到英语音素的映射,该模型在法语地名识别任务中相较仅使用音位(grapheme)偏置的基线模型实现16%的相对词错误率(WER)降低,相较仅使用词片的基线模型实现8%的相对WER降低,同时在通用英语任务上仅造成轻微性能下降。

ABSTRACT

Contextual automatic speech recognition, i.e., biasing recognition towards a given context (e.g. user's playlists, or contacts), is challenging in end-to-end (E2E) models. Such models maintain a limited number of candidates during beam-search decoding, and have been found to recognize rare named entities poorly. The problem is exacerbated when biasing towards proper nouns in foreign languages, e.g., geographic location names, which are virtually unseen in training and are thus out-of-vocabulary (OOV). While grapheme or wordpiece E2E models might have a difficult time spelling OOV words, phonemes are more acoustically salient and past work has shown that E2E phoneme models can better predict such words. In this work, we propose an E2E model containing both English wordpieces and phonemes in the modeling space, and perform contextual biasing of foreign words at the phoneme level by mapping pronunciations of foreign words into similar English phonemes. In experimental evaluations, we find that the proposed approach performs 16% better than a grapheme-only biasing model, and 8% better than a wordpiece-only biasing model on a foreign place name recognition task, with only slight degradation on regular English tasks.

研究动机与目标

  • 为解决在端到端语音识别中识别未登录词(OOV)的外语专有名词(尤其是低资源语言中的地理名称)的挑战。
  • 通过利用音素作为建模单元,提升端到端模型中的上下文偏置性能,音素在声学上更具显著性,对罕见或未见词更具鲁棒性。
  • 设计一种结合词片与音素的混合建模空间,在保持通用英语任务性能的同时,增强对外语词的识别能力。
  • 通过使用从外语音素到目标语言音素的音素级有限状态转换器(FST),实现无需重训练的可扩展跨语言偏置。

提出的方法

  • 模型在RNN-T架构中采用联合词片-音素建模空间,仅使用美式英语数据进行训练,以避免语言特异性偏差。
  • 在训练过程中,采用基于词频的采样策略,将罕见外语词拆分为音素,以提升鲁棒性并减少准确率下降。
  • 推理阶段,首先将外语词按其本民族语音素进行分词,然后利用先前研究中预定义的映射关系,将这些音素映射到相似的英语音素,构建音素级FST。
  • 该偏置FST接收英语音素序列并输出外语词,使束搜索(beam search)更倾向于选择音素上合理的外语名称,而无需修改模型本身。
  • 词片级和音素级偏置FST并行使用,共享权重,以充分利用两种建模单位的互补优势。
  • 系统采用浅层融合(shallow fusion)技术,通过加权组合方式,将上下文FST的得分与模型输出概率结合,对端到端模型输出进行重打分。

实验结果

研究问题

  • RQ1与音位或词片级偏置相比,音素级上下文偏置是否能提升端到端ASR模型对外语未登录专有名词的识别性能?
  • RQ2在建模空间中结合词片与音素,对未登录外语词及通用英语语音识别任务的性能有何影响?
  • RQ3随着偏置词数量的增加,识别准确率受到何种影响,特别是由于外语地名中前缀的音似性导致的混淆?
  • RQ4基于音素的偏置是否能减少在跨语言场景中对语言特异性语言模型或外部重打分模块的需求?
  • RQ5一个仅在英语上训练的单一模型,能否通过音素映射无需重训练即可有效识别多种语言的外语词?

主要发现

  • 所提出的词片-音素模型在法语地名识别任务中相较仅使用音位偏置的基线模型,实现16%的相对WER降低。
  • 与仅使用词片偏置的基线相比,该模型实现8%的相对WER改进,证明了音素级偏置在未登录词识别中的有效性。
  • 在音素级偏置基础上增加词片级偏置,带来额外2%的相对WER降低,表明两种方法具有互补性。
  • 当禁用偏置功能时,该模型在通用英语语音上的WER仅增加0.1%(绝对值),表明对标准任务的负面影响极小。
  • 由于外语地名中前缀的音似性,随着偏置词数量增加,WER迅速上升,凸显了覆盖范围与混淆之间的权衡。
  • 音素映射策略使该方法可直接应用于其他外语而无需模型重训练,支持可扩展的跨语言部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。