Skip to main content
QUICK REVIEW

[论文解读] Direct speech-to-speech translation with discrete units

Ann Lee, Peng‐Jen Chen|arXiv (Cornell University)|Jul 12, 2021
Speech Recognition and Synthesis被引用 7
一句话总结

本文提出一种直接的语音到语音翻译(S2ST)模型,该模型从自监督语音表征中预测离散单元,而非光谱图,从而实现无需文本中间步骤的端到端翻译。该方法在性能上与级联的S2T+TTS系统相当,同时将推理延迟和计算成本分别降低了最高55%的内存占用和47%的FLOPs,即使在未使用任何文本转录的情况下进行训练,也展现出对无文字语言的强大潜力。

ABSTRACT

We present a direct speech-to-speech translation (S2ST) model that translates speech from one language to speech in another language without relying on intermediate text generation. We tackle the problem by first applying a self-supervised discrete speech encoder on the target speech and then training a sequence-to-sequence speech-to-unit translation (S2UT) model to predict the discrete representations of the target speech. When target text transcripts are available, we design a joint speech and text training framework that enables the model to generate dual modality output (speech and text) simultaneously in the same inference pass. Experiments on the Fisher Spanish-English dataset show that the proposed framework yields improvement of 6.7 BLEU compared with a baseline direct S2ST model that predicts spectrogram features. When trained without any text transcripts, our model performance is comparable to models that predict spectrograms and are trained with text supervision, showing the potential of our system for translation between unwritten languages. Audio samples are available at https://facebookresearch.github.io/speech_translation/direct_s2st_units/index.html .

研究动机与目标

  • 开发一种绕过基于文本中间步骤的直接语音到语音翻译系统,以实现对无文字语言的翻译。
  • 通过建模离散单元而非原始光谱图特征,提升翻译质量和推理效率。
  • 通过共享编码器和部分共享解码器,在单次推理过程中实现语音和文本的联合生成。
  • 通过在源语音和目标语音中利用离散单元,证明无需文本转录即可有效训练直接S2ST模型。
  • 通过基准测试系统效率,表明所提方法在运行时间、FLOPs和内存使用方面优于直接S2ST和级联系统。

提出的方法

  • 使用自监督离散语音编码器(HuBERT)从目标语音中提取离散单元,替代直接S2ST中的光谱图目标。
  • 训练一个序列到序列的S2UT(语音到单元翻译)模型以预测这些离散单元,从而支持束搜索并改善对齐学习。
  • 对于有文字的语言,通过共享编码器和部分共享解码器,将S2ST和S2T任务联合训练,使用CTC解决语音和文本输出之间的长度不匹配问题。
  • 当缺乏文本转录时,通过在源语音和目标语音中均使用离散单元进行多任务学习,实现无需任何文本监督的端到端S2ST。
  • 将源语音单元作为辅助任务,以稳定训练并改善注意力对齐,显著提升性能。
  • 通过在Intel Xeon Gold 6230 CPU上比较所提方法与直接S2ST及级联S2T+TTS系统的运行时间、FLOPs和内存使用,评估系统效率。

实验结果

研究问题

  • RQ1能否使用离散语音单元而非光谱图特征来有效训练直接S2ST,从而提升翻译质量和效率?
  • RQ2通过共享建模实现的语音和文本联合生成,与级联的S2T+TTS系统相比,在翻译质量和推理成本方面有何差异?
  • RQ3能否通过在源语音和目标语音中利用离散单元,实现无需任何文本转录的直接S2ST系统训练?
  • RQ4与光谱图相比,建模离散单元是否能显著提升推理速度、FLOPs和内存使用?
  • RQ5将源语音单元作为辅助任务是否能显著改善S2UT中的注意力学习和翻译性能?

主要发现

  • 所提出的S2UT简化模型相比基线直接S2ST模型(预测光谱图特征)在BLEU上提升了6.7分,性能与级联S2T+TTS系统相当。
  • 在未使用任何文本转录的情况下训练,模型性能可与使用文本监督训练的光谱图预测模型相媲美,从而实现对无文字语言的翻译。
  • 与S2T+TTS级联系统基线相比,该系统速度快1.5倍,FLOPs降低47%,内存使用减少55%。
  • 与预测光谱图的基于Transformer的Translatotron模型相比,S2UT简化模型运行速度快1.3倍,FLOPs降低39%,内存使用减少51%。
  • 与不使用该信号的训练相比,将源语音单元作为辅助任务使S2UT性能提升1.4 BLEU点,表明其在稳定注意力学习方面的有效性。
  • 通过CTC实现长度对齐的语音-文本联合训练框架,可在单次推理过程中同时生成语音和文本输出,提升效率和输出连贯性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。