Skip to main content
QUICK REVIEW

[论文解读] Speech Corpus of Ainu Folklore and End-to-end Speech Recognition for Ainu Language

Kohei Matsuura, Sei Ueno|arXiv (Cornell University)|Feb 16, 2020
Speech Recognition and Synthesis参考文献 34被引用 12
一句话总结

本文提出了一种阿伊努语民间传说语音语料库,并为濒临灭绝的阿伊努语开发了一个端到端自动语音识别(ASR)系统。采用基于音节的建模方式,结合混合CTC-attention模型,在说话人封闭设置下实现了80%的词准确率和90%的音素准确率,在说话人开放设置下实现了60%的词准确率;多语言预训练进一步将开放集性能提升了10%的相对WER降低。

ABSTRACT

Ainu is an unwritten language that has been spoken by Ainu people who are one of the ethnic groups in Japan. It is recognized as critically endangered by UNESCO and archiving and documentation of its language heritage is of paramount importance. Although a considerable amount of voice recordings of Ainu folklore has been produced and accumulated to save their culture, only a quite limited parts of them are transcribed so far. Thus, we started a project of automatic speech recognition (ASR) for the Ainu language in order to contribute to the development of annotated language archives. In this paper, we report speech corpus development and the structure and performance of end-to-end ASR for Ainu. We investigated four modeling units (phone, syllable, word piece, and word) and found that the syllable-based model performed best in terms of both word and phone recognition accuracy, which were about 60% and over 85% respectively in speaker-open condition. Furthermore, word and phone accuracy of 80% and 90% has been achieved in a speaker-closed setting. We also found out that a multilingual ASR training with additional speech corpora of English and Japanese further improves the speaker-open test accuracy.

研究动机与目标

  • 为应对语言保护的迫切需求,通过创建大规模、带标注的阿伊努语民间传说语音语料库,推动濒危语言的记录与保存。
  • 为阿伊努语——一种低资源、濒临灭绝且无标准化书写系统的语言——开发端到端自动语音识别(ASR)系统。
  • 评估不同建模单元(音素、音节、词片、词)在低资源设置下的ASR性能影响。
  • 探究使用日语和英语语料库进行多语言预训练对提升低资源语言(如阿伊努语)ASR性能的有效性。
  • 通过数据增强和迁移学习技术,缩小说话人封闭与说话人开放ASR设置之间的性能差距。

提出的方法

  • 从阿伊努博物馆和二股阿伊努文化博物馆收集了38.5小时的阿伊努语民间传说录音,重点聚焦于叙事性讲述。
  • 采用混合端到端ASR模型,结合连接时序分类(CTC)与注意力解码,使用加权损失函数:$\mathcal{L}_{\rm{all}} = \lambda\mathcal{L}_{\rm{attn}} + (1-\lambda)\mathcal{L}_{\rm{CTC}}$,其中$\lambda = 0.5$。
  • 评估四种建模单元:音素(约25个)、音节(约500个)、词片(500个)和词(5,000个),稀有词以<unk>替代。
  • 通过将阿伊努语数据与日语(JNAS)和英语(WSJ)语料库结合,进行多语言预训练,30个周期后在阿伊努语数据上微调。
  • 为CTC辅助任务使用音素级标签,以提升泛化能力,尤其在低资源场景下。
  • 采用按说话人划分的评估方式,对各说话人结果进行加权平均,以评估说话人封闭与说话人开放条件下的性能。

实验结果

研究问题

  • RQ1在阿伊努语的端到端ASR中,哪种建模单元——音素、音节、词片或词——能实现最高的词与音素识别准确率?
  • RQ2使用日语和英语语音语料库进行多语言预训练,能否提升阿伊努语ASR系统的性能,特别是在说话人开放设置下?
  • RQ3ASR系统的性能在说话人封闭与说话人开放评估之间如何变化?导致性能差距的因素有哪些?
  • RQ4阿伊努语中的复合词在何种程度上导致了高词错误率(WER),尽管音素错误率(PER)较低?
  • RQ5在低资源、黏着性语言如阿伊努语中,使用音节作为建模单元是否能提供比词级建模更优的覆盖范围与约束?

主要发现

  • 基于音节的建模单元表现最佳,在说话人封闭设置下,词错误率(WER)为20%,音素错误率(PER)为6%。
  • 在说话人开放设置下,音节模型实现了60%的词准确率,WER为14%,PER为14%,表明不同说话人之间存在显著差异。
  • 基于词的模型表现较差,某些情况下WER高达30%,主要由于频繁生成<unk>标记以及复合词切分错误。
  • 使用日语(JNAS)和英语(WSJ)数据进行多语言预训练,在说话人开放设置下使WER相对降低10%,其中JNAS效果更优,因其语言相似性更高。
  • 在说话人封闭设置下,ASR系统实现了94%的音素准确率,在说话人开放设置下为86%,表明在低资源条件下仍具备强大的语音识别能力。
  • WER与PER之间的差异——例如WER为57%而PER为0%——表明词切分错误,特别是复合词的切分错误,是阿伊努语ASR中的主要挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。