Skip to main content
QUICK REVIEW

[论文解读] Swiss Parliaments Corpus, an Automatically Aligned Swiss German Speech to Standard German Text Corpus

Michel Plüss, Lukas Neukom|arXiv (Cornell University)|Oct 6, 2020
Natural Language Processing Techniques参考文献 20被引用 8
一句话总结

本文介绍了瑞士议会语料库(SPC),这是一个包含293小时自动对齐的瑞士德语语音-标准德语文本语料库,通过一种新颖的强制句子对齐方法结合基于IoU的质量评估器,作者在微调后的Conformer自动语音识别(ASR)模型上实现了0.278的WER和0.586的BLEU分数,从而实现了低资源瑞士德语方言的高质量端到端ASR。

ABSTRACT

We present the Swiss Parliaments Corpus (SPC), an automatically aligned Swiss German speech to Standard German text corpus. This first version of the corpus is based on publicly available data of the Bernese cantonal parliament and consists of 293 hours of data. It was created using a novel forced sentence alignment procedure and an alignment quality estimator, which can be used to trade off corpus size and quality. We trained Automatic Speech Recognition (ASR) models as baselines on different subsets of the data and achieved a Word Error Rate (WER) of 0.278 and a BLEU score of 0.586 on the SPC test set. The corpus is freely available for download.

研究动机与目标

  • 通过创建一个公开可用的自动对齐语料库,解决瑞士德语自动语音识别(ASR)缺乏大规模高质量训练数据的问题。
  • 开发一种强制句子对齐流程,以处理瑞士德语与标准德语之间存在的语言不匹配问题,如句子顺序变化。
  • 使端到端ASR模型能够从瑞士德语语音中学习,并生成准确的标准德语文本转录。
  • 为未来在低资源瑞士德语方言语音到文本翻译研究中提供基准。
  • 探索基于IoU的估计器在数据过滤方面对模型性能和语料质量的影响。

提出的方法

  • 该语料库由公开获取的伯尔尼州议会会议录音和转录文本构建,总计293小时音频。
  • 提出一种新颖的强制句子对齐流程,利用预训练的标准德语ASR模型对音频进行转录并生成词级别时间戳。
  • 通过Needleman-Wunsch算法实现全局对齐,将ASR转录结果与人工标准德语转录结果在句子级别进行映射。
  • 采用学习得到的IoU(交并比)估计器对低质量对齐结果进行过滤,从而在语料规模与质量之间实现权衡。
  • 对齐过程包括使用spaCy进行句子切分,以及通过ASR输出的词级别时间戳实现时间映射。
  • 在语料库的过滤子集上训练基线ASR模型(Transformer和Conformer),采用数据增强和联合CTC/CE损失。

实验结果

研究问题

  • RQ1强制句子对齐流程是否能有效处理瑞士德语与标准德语之间存在的语言不匹配问题,如词序变化?
  • RQ2基于IoU的过滤机制如何改善自动对齐语音-文本语料库的质量与规模之间的权衡?
  • RQ3在低资源瑞士德语语音-标准德语语料库上训练的端到端ASR模型能够达到怎样的性能?
  • RQ4在此语音到文本翻译设置中,WER与BLEU分数的相关性如何?
  • RQ5训练后的ASR模型是否可用于在自迭代改进的流水线中持续优化对齐过程?

主要发现

  • 表现最佳的Conformer ASR模型在SPC测试集上实现了0.278的词错误率(WER)和0.586的BLEU分数。
  • 在所有数据划分中,Conformer模型均优于Transformer模型,表明其在该低资源设置下的适用性。
  • 通过IoU估计器对数据进行过滤,可在保留约70%数据的同时实现性能损失最小化,从而在不牺牲准确性的前提下加快训练速度。
  • WER与BLEU分数呈现负相关,表明这两个指标在评估此语音到文本任务时均可靠且具有互补性。
  • 该语料库可免费下载,是未来瑞士德语ASR与语音翻译研究的基石性资源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。