Skip to main content
QUICK REVIEW

[论文解读] Speech Resources in the Tamasheq Language

Marcely Zanon Boito, Fethi Bougares|arXiv (Cornell University)|Jan 13, 2022
Speech Recognition and Synthesis被引用 12
一句话总结

本论文为马里和尼日尔使用的低资源柏柏尔语塔马什克语引入了两项新的语音资源:一个671小时的多语言音频语料库(包含224小时的塔马什克语)和一个17小时的塔马什克语-法语平行语音翻译语料库,提供逐句翻译。这些资源以CC BY-NC-ND 3.0许可证共享,旨在通过使用涵盖多种非洲语言的真实广播新闻数据,推动低资源语音翻译研究,支持模型的训练与基准测试。

ABSTRACT

In this paper we present two datasets for Tamasheq, a developing language mainly spoken in Mali and Niger. These two datasets were made available for the IWSLT 2022 low-resource speech translation track, and they consist of collections of radio recordings from daily broadcast news in Niger (Studio Kalangou) and Mali (Studio Tamani). We share (i) a massive amount of unlabeled audio data (671 hours) in five languages: French from Niger, Fulfulde, Hausa, Tamasheq and Zarma, and (ii) a smaller 17 hours parallel corpus of audio recordings in Tamasheq, with utterance-level translations in the French language. All this data is shared under the Creative Commons BY-NC-ND 3.0 license. We hope these resources will inspire the speech community to develop and benchmark models using the Tamasheq language.

研究动机与目标

  • 为解决塔马什克语(马里和尼日尔地区使用的图德雷语方言)等低资源语言缺乏标注语音资源的问题。
  • 通过提供高质量、真实世界的广播新闻录音,支持低资源语音转写与语音翻译系统的发展。
  • 支持利用来自地理位置上共现语言(如法语、豪萨语、富拉尼语、扎尔马语)的多语言未标注音频数据,提升塔马什克语模型性能的研究。
  • 通过使用真实、多样化且具有区域代表性的数据,支持在IWSLT 2022低资源语音翻译赛道中进行基准测试。

提出的方法

  • 音频数据从当地广播电台制作的日常新闻节目收集:尼日尔的Studio Kalangou和马里的Studio Tamani,获得Fondation Hirondelle的授权。
  • 通过母语塔马什克语者的手动翻译,随后由熟练的法语母语者进行校对,使用Transcriber工具进行标注,创建了17小时的塔马什克语-法语平行语料库。
  • 多语言音频语料库包含224小时的塔马什克语、417小时其他尼日尔语(法语、富拉尼语、豪萨语、扎尔马语),数据源自网络爬取的广播节目.mp3文件。
  • 使用自监督预训练(如wav2vec2.0)和迁移学习技术,在塔马什克语数据上微调语音识别与翻译模型。
  • 数据整理时注重语音质量,尽量减少背景噪音和语音重叠,并为部分语句添加了性别标注。
  • 所有资源均以知识共享CC BY-NC-ND 3.0许可证发布,以促进开放研究与模型开发。

实验结果

研究问题

  • RQ1在包括塔马什克语在内的多种非洲语言上进行多语言自监督预训练,能否提升低资源语音翻译性能?
  • RQ2在相同地理区域内,未标注的多语言音频数据在多大程度上可被利用以提升塔马什克语语音识别与翻译性能?
  • RQ3与纯无监督方法相比,小规模但高质量的塔马什克语-法语平行语料库在训练端到端语音翻译模型方面的有效性如何?
  • RQ4在低资源语音翻译设置中,数据质量和标注一致性对模型性能的影响如何?
  • RQ5从高资源语言(如法语)进行迁移学习,能否提升塔马什克语语音转写与语音翻译系统?

主要发现

  • 本研究发布了包含224小时塔马什克语语音的671小时多语言音频语料库,以及来自尼日尔的417小时法语、富拉尼语、豪萨语和扎尔马语录音,支持跨语言预训练。
  • 创建了17小时的塔马什克语-法语平行语音翻译语料库,提供逐句翻译,为监督训练提供了宝贵资源。
  • 数据源自真实的日常新闻广播,确保了在真实应用场景中的语言与文化相关性。
  • 这些资源以CC BY-NC-ND 3.0许可证发布,促进了低资源语音翻译领域的开放研究与可复现性。
  • 语料库为部分语句添加了性别标注,支持对语音与说话人特征的细粒度分析。
  • 本工作为IWSLT 2022低资源语音翻译赛道的基准测试提供了基础,支持数据高效与多语言语音模型的研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。