[论文解读] Bytes are All You Need: End-to-End Multilingual Speech Recognition and Synthesis with Bytes
本论文提出端到端多语言语音识别(音频转字节,A2B)与语音合成(字节转音频,B2A)模型,采用UTF-8编码的Unicode字节作为文本表示单位。通过利用固定的256个词表字节空间,模型消除了对大型、语言特定的音素或子词词表的需求,实现了高效的多语言建模,在平均上相较单语言基线模型实现4.4%的相对WER提升,且在日语-英语混语数据上实现38.6%的相对提升。
We present two end-to-end models: Audio-to-Byte (A2B) and Byte-to-Audio (B2A), for multilingual speech recognition and synthesis. Prior work has predominantly used characters, sub-words or words as the unit of choice to model text. These units are difficult to scale to languages with large vocabularies, particularly in the case of multilingual processing. In this work, we model text via a sequence of Unicode bytes, specifically, the UTF-8 variable length byte sequence for each character. Bytes allow us to avoid large softmaxes in languages with large vocabularies, and share representations in multilingual models. We show that bytes are superior to grapheme characters over a wide variety of languages in monolingual end-to-end speech recognition. Additionally, our multilingual byte model outperform each respective single language baseline on average by 4.4% relatively. In Japanese-English code-switching speech, our multilingual byte model outperform our monolingual baseline by 38.6% relatively. Finally, we present an end-to-end multilingual speech synthesis model using byte representations which matches the performance of our monolingual baselines.
研究动机与目标
- 为解决多语言语音处理中大型稀疏音素词表的挑战,特别是日语和韩语等拥有数万个字符的语言。
- 通过使用UTF-8字节实现语言无关的表示,消除对语言特定词典和发音词典的需求。
- 实现可扩展、紧凑且可扩展的多语言ASR与TTS模型,能够通过增量方式添加新语言,而无需改变模型架构。
- 在单语言与多语言设置下(包括混语场景),评估基于字节的模型相较于基于音素的基线模型的性能。
提出的方法
- 音频转字节(A2B)模型采用听觉-注意-拼写(LAS)架构,将原始音频直接映射为UTF-8编码字节序列,取代音素或子词输出。
- 字节转音频(B2A)模型基于Tacotron 2,从输入字节序列生成语音,实现使用共享256字节词表的端到端多语言TTS。
- 在多语言训练中,通过以小混合比例逐步添加新语言来实现增量训练,防止灾难性遗忘,同时保持相同模型结构。
- 使用1-of-K语言向量对A2B模型进行条件控制,通过在推理时实现语言特定适应,提升多语言数据上的性能。
- 模型完全基于字节运行,避免了对语言特定分词或子词分割的需求,支持任意Unicode文本的无缝处理。
- 系统通过将混合语言文本视为连续字节流来支持混语,无需语言边界检测或分割。
实验结果
研究问题
- RQ1UTF-8字节序列能否作为多语言端到端语音识别与合成的有效且可扩展的文本表示单位,替代音素或子词?
- RQ2在具有大音素词表的语言中,基于字节的模型相较于基于音素的模型在单语言与多语言ASR中的性能表现如何?
- RQ3基于字节的模型在无需显式语言边界建模的情况下,对混语语音(如日语-英语混合语句)的处理能力如何?
- RQ4单个基于字节训练的多语言模型能否在TTS中实现与单语言基线模型相当的性能,同时保持模型紧凑性与可扩展性?
- RQ5使用字节级表示进行增量语言添加是否能防止性能下降,并实现对新语言的高效扩展?
主要发现
- A2B模型在日语和韩语上的表现优于A2C(基于音素)模型,在日语-英语混语数据上实现38.6%的相对WER改进,表明其在处理OOV和混合语言内容方面具有显著优势。
- 平均而言,多语言A2B模型在四种语言(英语、日语、西班牙语、韩语)上相较各自单语言基线模型实现4.4%的相对WER改进。
- 通过使用语言混合比例进行增量训练的多语言A2B模型优于从零开始训练的模型,并在各类语言间保持了强大的泛化能力。
- B2A模型在平均意见评分(MOS)上与单语言基于音素的TTS模型相当——英语为4.23±0.14,普通话为3.42±0.12,西班牙语为4.23±0.10,表明语音自然度达到同等水平。
- 基于字节的TTS模型成功合成了混语文本,尽管目前尚无标准化指标用于评估此类情况下的流畅性或说话人一致性。
- 在多语言A2B模型中使用1-of-K语言向量可提升性能,但因仅在语句级别提供语言信息,对混语数据的增益有限,提示帧级语言条件控制可能更具潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。