Skip to main content
QUICK REVIEW

[论文解读] PolyVoice: Language Models for Speech to Speech Translation

Qianqian Dong, Zhiying Huang|arXiv (Cornell University)|Jun 5, 2023
Speech Recognition and Synthesis被引用 5
一句话总结

PolyVoice 提出了一种基于语言模型的新型语音到语音翻译框架,利用无监督离散语义单元,结合仅解码器的翻译语言模型与基于单元的语音语言模型,实现保留说话人特征的语音合成。该方法在翻译质量和语音质量方面均达到最先进水平,即使在无目标语言文本监督的无文字语言中也表现优异。

ABSTRACT

We propose PolyVoice, a language model-based framework for speech-to-speech translation (S2ST) system. Our framework consists of two language models: a translation language model and a speech synthesis language model. We use discretized speech units, which are generated in a fully unsupervised way, and thus our framework can be used for unwritten languages. For the speech synthesis part, we adopt the existing VALL-E X approach and build a unit-based audio language model. This grants our framework the ability to preserve the voice characteristics and the speaking style of the original speech. We examine our system on Chinese $ ightarrow$ English and English $ ightarrow$ Spanish pairs. Experimental results show that our system can generate speech with high translation quality and audio quality. Speech samples are available at https://speechtranslation.github.io/polyvoice.

研究动机与目标

  • 开发一种直接的端到端语音到语音翻译系统,绕过级联流水线并避免依赖转录的目标语言文本。
  • 通过使用从自监督模型中提取的完全无监督离散语音单元,实现对无文字语言的翻译。
  • 通过基于单元的语音语言模型,在合成语音中保留说话人身份和说话风格。
  • 评估仅解码器语言模型在 S2ST 中相对于传统编码器-解码器架构的有效性。
  • 通过提示工程探索多任务学习,联合优化翻译、ASR、MT、TTS 和 ST 任务。

提出的方法

  • 系统使用仅解码器语言模型(U-XLM)将源语言语义单元翻译为目标语言语义单元,取代传统的编码器-解码器结构。
  • 语义单元通过自监督语音表征模型(如 mHuBERT)以完全无监督的方式提取,从而覆盖无文字语言。
  • 基于 VALL-E X 框架训练了从单元到语音(U2S)的语言模型,通过条件化于源语音单元和说话人特征,实现零样本语音克隆。
  • U2S 模型将源语音单元序列、目标语义单元和源语音特征作为提示输入,生成目标语音特征。
  • 单元声码器将预测的语音特征转换为波形,保留语调和说话人身份。
  • 通过提示工程实现多任务学习,使用不同任务特定的提示,使单个统一模型能够同时在 ASR、MT、ST、TTS 和 S2ST 数据上进行训练。

实验结果

研究问题

  • RQ1仅解码器语言模型是否能在直接语音到语音翻译中相比传统编码器-解码器模型取得更优性能?
  • RQ2完全无监督的离散语义单元是否能实现无需任何转录目标语言数据的无文字语言 S2ST?
  • RQ3基于单元的语音语言模型在合成语音中在多大程度上能保留说话人身份和自然度?
  • RQ4通过提示工程实现的多任务学习在多个语音和语言任务中如何提升性能?
  • RQ5语义单元的质量对整体 S2ST 性能有何影响?联合训练多语言数据是否能提升单元质量?

主要发现

  • 仅解码器架构在英语到西班牙语 S2ST 上取得了 22.0 的 BLEU 分数,相比编码器-解码器基线高出 3.9 BLEU 点。
  • 该系统在无任何西班牙语文本转录的情况下,语音合成的 ASR-BLEU 达到 18.3,证明了其在无文字语言中的能力。
  • U2S 语音合成模型的 WER 为 6.40,自然度得分为 3.98,ASV 得分为 0.38,相比 VALL-E X 在自然度和鲁棒性方面表现更优。
  • 移除时长模型后 WER 上升至 31.93,表明在缺乏固有时长信息的无监督单元中,时长建模至关重要。
  • 使用多语言 mHuBERT(zh_en)进行单元提取可将 WER 降低至 4.76,表明更大规模的多语言模型能提升语义单元质量。
  • 通过共享提示的多任务学习使 S2ST BLEU 提升至 29.4,MT BLEU 提升至 33.81,证明了跨任务统一建模的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。