Skip to main content
QUICK REVIEW

[论文解读] SDS-200: A Swiss German Speech to Standard German Text Corpus

Michel Plüss, Manuela Hürlimann|arXiv (Cornell University)|May 19, 2022
Natural Language Processing Techniques被引用 6
一句话总结

本论文介绍了SDS-200,这是一个包含200小时多语种苏黎世德语语音-标准德语文本的语料库,涵盖方言、年龄和性别标注,通过公开的网络录音工具收集,参与者将标准德语文本翻译并以当地苏黎世德语方言录制。该语料库可用于训练语音翻译、方言识别和语音合成系统,在微调XLS-R模型时实现了21.6的WER和64.0的BLEU分数,显著优于基线Transformer模型。

ABSTRACT

We present SDS-200, a corpus of Swiss German dialectal speech with Standard German text translations, annotated with dialect, age, and gender information of the speakers. The dataset allows for training speech translation, dialect recognition, and speech synthesis systems, among others. The data was collected using a web recording tool that is open to the public. Each participant was given a text in Standard German and asked to translate it to their Swiss German dialect before recording it. To increase the corpus quality, recordings were validated by other participants. The data consists of 200 hours of speech by around 4000 different speakers and covers a large part of the Swiss-German dialect landscape. We release SDS-200 alongside a baseline speech translation model, which achieves a word error rate (WER) of 30.3 and a BLEU score of 53.1 on the SDS-200 test set. Furthermore, we use SDS-200 to fine-tune a pre-trained XLS-R model, achieving 21.6 WER and 64.0 BLEU.

研究动机与目标

  • 为解决低资源方言缺乏公开可用、高质量的多语种苏黎世德语语音转文本数据集的问题。
  • 创建一个多样化、公开可访问的语料库,覆盖瑞士全境广泛的苏黎世德语方言。
  • 支持端到端语音翻译、方言识别和苏黎世德语语音合成系统的发展。
  • 通过结合公众数据收集与自监督预训练,提升低资源语音转文本翻译的性能。
  • 通过公众参与和游戏化机制,在未来版本中进一步扩大语料库规模与多样性。

提出的方法

  • 开发了一款基于网络的公开录音工具,用于收集苏黎世德语语音对标准德语文本的翻译,使瑞士各地的说话者均可参与。
  • 参与者被要求以所在地区的苏黎世德语方言朗读给定的标准德语句子,以确保语言多样性与真实世界中的方言差异。
  • 录音由其他参与者进行验证,以确保数据质量并减少转录与对齐中的错误。
  • 语料库通过语音与文本之间的自动对齐构建,包含说话人方言、年龄和性别的元数据。
  • 基线模型使用FAIRSEQ S2T库中的基于Transformer的架构进行训练,超参数设置为默认值。
  • 在SDS-200数据集上微调了在436,000小时多语种未标注语音数据上预训练的XLS-R Wav2vec模型,以评估自监督预训练的优势。

实验结果

研究问题

  • RQ1通过公众收集的、具有方言多样性的语音转文本语料库,能否提升苏黎世德语语音翻译的性能?
  • RQ2在大规模未标注语音数据上进行自监督预训练,如何提升苏黎世德语低资源语音翻译的性能?
  • RQ3将SDS-200与现有语料库(如SPC)结合,能在多大程度上提升模型的泛化能力与性能?
  • RQ4SDS-200的方言覆盖范围在多大程度上代表了瑞士各州实际的语言分布?
  • RQ5说话人的人口统计多样性(年龄、性别、方言)对语音翻译中模型鲁棒性与泛化能力有何影响?

主要发现

  • 仅在语料库上训练的基线Transformer模型在SDS-200测试集上实现了30.3的词错误率(WER)和53.1的BLEU分数。
  • 在SDS-200上微调XLS-R(0.3B)模型后,WER降低至21.6,BLEU分数提升至64.0,证明即使预训练数据中不含苏黎世德语,自监督预训练仍具有显著优势。
  • 该语料库覆盖了广泛的苏黎世德语方言,瓦莱州和苏黎世州的方言代表性较强,且某些地区有来自个别说话人的显著贡献。
  • 语料库包含约3,816名唯一说话人的142,545条语音,其中86%的参与者未披露性别,4名参与者自认为非二元性别。
  • 语料库包含138,553条唯一句子和41,289个德语词汇,支持多样的语言内容,并广泛覆盖词汇与句法结构。
  • 本研究证明,结合公众数据收集与验证机制,可生成高质量、可扩展且语言代表性强的语音资源,适用于低资源语言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。