[论文解读] Dialectal Speech Recognition and Translation of Swiss German Speech to Standard German Text: Microsoft's Submission to SwissText 2021
本论文介绍了微软在瑞士语2021年共享任务(SwissText 2021 shared task)中获胜的瑞士语语音转写翻译方法,结合了混合式自动语音识别(ASR)系统与一种将瑞士德语发音直接映射到标准德语翻译的词典。该系统利用高德语ASR模型进行迁移学习,采用针对方言形态学特性的自定义首次通过语言模型,并结合二次神经重打分,最终在盲测集上达到46.04%的BLEU分数,相较第二名系统实现12%的相对性能提升。
This paper describes the winning approach in the Shared Task 3 at SwissText 2021 on Swiss German Speech to Standard German Text, a public competition on dialect recognition and translation. Swiss German refers to the multitude of Alemannic dialects spoken in the German-speaking parts of Switzerland. Swiss German differs significantly from standard German in pronunciation, word inventory and grammar. It is mostly incomprehensible to native German speakers. Moreover, it lacks a standardized written script. To solve the challenging task, we propose a hybrid automatic speech recognition system with a lexicon that incorporates translations, a 1st pass language model that deals with Swiss German particularities, a transfer-learned acoustic model and a strong neural language model for 2nd pass rescoring. Our submission reaches 46.04% BLEU on a blind conversational test set and outperforms the second best competitor by a 12% relative margin.
研究动机与目标
- 为解决将低资源瑞士德语方言识别并转写为标准德语文本的挑战。
- 克服瑞士德语与标准德语之间在拼写标准化程度、语音、词汇及语法结构上的显著差异。
- 通过迁移学习与结构化语言建模,提升低资源方言环境下的自动语音识别性能。
- 在公开的方言语音识别与翻译竞赛中取得最先进水平的结果。
提出的方法
- 一种混合式自动语音识别(ASR)系统,配备将瑞士德语发音映射到标准德语翻译的词典,涵盖复合词与代词缩合等形态现象。
- 一种专为处理瑞士德语复合词与代词缩合现象而设计的首次通过语言模型,通过合并词对进行插值训练。
- 使用10,000小时高德语ASR预训练数据集进行迁移学习微调的LC-BLSTM声学模型,采用80维对数梅尔滤波器组特征,并结合160维上下文拼接。
- 一种二次通过神经语言模型,用于对ASR系统输出的前100名候选结果进行重打分,采用强大的Transformer架构语言模型以纠正翻译中的瑕疵。
- 在训练过程中使用音译的瑞士德语形式进行强制对齐,以减少早期训练阶段的发音歧义。
- 通过合并词对并将未合并的LM组件进行插值,将代词缩合形式如'haben#wir'整合进词典与语言模型中。
实验结果
研究问题
- RQ1如何使混合式ASR系统适应瑞士德语的形态复杂性,包括复合词与代词缩合现象?
- RQ2从高资源标准德语ASR模型进行迁移学习,在低资源瑞士德语语音识别任务中能带来多大程度的性能提升?
- RQ3与标准语言模型相比,针对瑞士德语形态学特性的定制化语言模型是否能显著提升识别与翻译质量?
- RQ4二次通过神经重打分在减少方言语音转写任务中的翻译瑕疵并提升BLEU分数方面有多高效?
主要发现
- 该系统在盲测对话测试集上达到46.04%的BLEU分数,相较第二名系统实现12%的相对性能提升。
- 与在瑞士议会数据集上从零开始训练相比,迁移学习使WER降低8.4%,BLEU提升11.6%。
- 额外加入50小时内部瑞士德语数据后,WER进一步降低2.3%,BLEU提升2.5%。
- 通过强效神经语言模型进行二次重打分,使WER降低5.8%,BLEU提升8.9%。
- 消融实验表明,迁移学习、内部数据与重打分组件均对最终性能有显著贡献。
- 完整系统训练约需1200 GPU小时,使用8块GPU训练25个周期。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。