Skip to main content
QUICK REVIEW

[论文解读] Speech-to-Speech Translation For A Real-world Unwritten Language

Peng‐Jen Chen, Kevin Tran|arXiv (Cornell University)|Nov 11, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本论文提出首个针对无文字书写系统的台湾闽南语的端到端语音到语音翻译(S2ST)系统,结合人工标注数据、伪标签弱监督数据及挖掘的平行语音数据,实现从英语到台湾闽南语的语音翻译。该系统通过利用普通话作为文本代理进行监督,取得当前最先进性能,并发布一个60小时的基准数据集,以推动无文字语言的低资源S2ST研究。

ABSTRACT

We study speech-to-speech translation (S2ST) that translates speech from one language into another language and focuses on building systems to support languages without standard text writing systems. We use English-Taiwanese Hokkien as a case study, and present an end-to-end solution from training data collection, modeling choices to benchmark dataset release. First, we present efforts on creating human annotated data, automatically mining data from large unlabeled speech datasets, and adopting pseudo-labeling to produce weakly supervised data. On the modeling, we take advantage of recent advances in applying self-supervised discrete representations as target for prediction in S2ST and show the effectiveness of leveraging additional text supervision from Mandarin, a language similar to Hokkien, in model training. Finally, we release an S2ST benchmark set to facilitate future research in this field. The demo can be found at https://huggingface.co/spaces/facebook/Hokkien_Translation .

研究动机与目标

  • 开发一种针对无文字书写系统的低资源端到端S2ST系统,用于英语到台湾闽南语的语音翻译,该语言缺乏标准化书写系统。
  • 通过结合人工标注、伪标签法与无标签语音数据挖掘,缓解无文字语言中平行语音数据稀缺的问题。
  • 评估利用密切相关的书面语言(普通话)在低资源S2ST中用于数据生成与模型训练的有效性。
  • 发布公开基准数据集与评估模型,以支持未来针对无文字语言的S2ST研究。

提出的方法

  • 使用基于HuBERT的自监督语音编码器从目标闽南语语音中提取离散单元,实现单元到波形的生成,用于语音合成。
  • 利用真实闽南语语音数据进行语音归一化,以减少说话人差异性,提升模型泛化能力。
  • 通过普通话建立英语与闽南语之间的联合嵌入空间,实现从无标签英语与闽南语语音对中挖掘平行数据。
  • 训练两阶段S2ST模型:一种采用单次遍历的语音到单元翻译(S2UT),另一种采用两阶段解码并引入普通话文本监督。
  • 通过普通话S2T进行伪标签生成,从挖掘的英语-闽南语语音对中构建弱监督数据。
  • 结合人工标注、弱监督与挖掘数据,训练基于UnitY的S2ST模型,并通过相似度分数过滤以提升数据质量。

实验结果

研究问题

  • RQ1在平行数据有限的情况下,能否有效训练针对无文字语言(如台湾闽南语)的端到端S2ST系统?
  • RQ2在低资源S2ST中,利用相关书面语言(普通话)是否能有效提升数据构建与模型训练效果?
  • RQ3当与弱监督数据及人工标注数据结合时,从无标签语料中挖掘平行语音数据在多大程度上能提升S2ST性能?
  • RQ4在低资源S2ST中,使用真实目标语音数据进行语音归一化是否优于基于合成参考的方法?
  • RQ5数据质量与领域不匹配对挖掘数据在S2ST系统中性能的影响如何?

主要发现

  • 当使用197小时挖掘的S2ST数据进行训练时,UnitY模型在BLEU上提升了4.5分,证明在低资源环境下,噪声伪标签数据具有显著价值。
  • 在人工标注数据基础上增加4.7千小时挖掘的闽南语→英语S2T数据,BLEU提升3.6分,但随着数据量增大,增益逐渐减弱,主要因领域不匹配所致。
  • 人工标注、弱监督与挖掘数据的组合相较仅使用人工标注与弱监督数据,带来1.6分BLEU的增益,表明三者具有叠加优势。
  • 采用普通话文本监督的两阶段解码策略优于单阶段S2UT,使英语→闽南语任务的BLEU达到7.8分,表明额外文本监督可带来显著性能提升。
  • 成功发布基准数据集(含60小时人工标注数据)与评估模型,为未来无文字语言S2ST研究提供支持。
  • 基于普通话S2T的伪标签法提供了有效的数据增强,显著缩小了弱监督与完全监督模型之间的性能差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。