[论文解读] SONAR: Sentence-Level Multimodal and Language-Agnostic Representations
Sonar 引入了一种多语言、多模态的句子嵌入空间,通过编码器-解码器框架联合优化翻译、自编码和去噪目标进行训练,实现了多语言相似度搜索和零样本语音到文本翻译的最先进性能。它利用单一文本编码器支持 200 种语言,并结合语言特定的语音编码器,实现跨语言和跨模态检索,相关开源模型已发布在 GitHub 上。
We introduce SONAR, a new multilingual and multimodal fixed-size sentence embedding space. Our single text encoder, covering 200 languages, substantially outperforms existing sentence embeddings such as LASER3 and LabSE on the xsim and xsim++ multilingual similarity search tasks. Speech segments can be embedded in the same SONAR embedding space using language-specific speech encoders trained in a teacher-student setting on speech transcription data. Our encoders outperform existing speech encoders on similarity search tasks. We also provide a text decoder for 200 languages, which allows us to perform text-to-text and speech-to-text machine translation, including for zero-shot language and modality combinations. Our text-to-text results are competitive compared to the state-of-the-art NLLB~1B model, despite the fixed-size bottleneck representation. Our zero-shot speech-to-text translation results compare favorably with strong supervised baselines such as Whisper.
研究动机与目标
- 开发一个统一的、与语言无关的句子嵌入空间,支持 200 种语言的文本和语音模态。
- 通过在单一框架中结合翻译、自编码和去噪目标,提升多语言句子表征学习。
- 利用教师-学生训练设置,通过多语言文本编码器作为教师,实现零样本语音到文本翻译。
- 评估不同训练目标在多语言和多模态设置下的语义相似度和解码性能影响。
- 为广泛的研究和应用提供开源的文本和语音编码器,以及多语言文本解码器。
提出的方法
- Sonar 框架采用基于 NLLB 1B 模型初始化的多语言编码器-解码器架构,学习固定大小的句子嵌入。
- 联合优化翻译、自编码和去噪目标,并引入跨语言相似度损失,以增强与语言无关的表征。
- 37 种语言的语音编码器通过教师-学生蒸馏过程进行训练,使用多语言文本编码器作为教师,ASR 转录作为监督信号。
- 框架利用跨模态共享的嵌入空间,支持跨模态相似度搜索和零样本翻译。
- 文本解码器端到端训练,以支持跨语言对的零样本文本到文本和语音到文本翻译。
- 所有模型,包括文本和语音编码器以及文本解码器,均已发布在 GitHub 上供公开使用。
实验结果
研究问题
- RQ1不同的训练目标——翻译、自编码、去噪和跨语言相似度——如何影响固定大小瓶颈中多语言句子嵌入的质量?
- RQ2通过联合目标训练的单一多语言文本编码器,是否能在多语言相似度搜索任务中超越现有的最先进句子嵌入模型(如 Laser3 和 LabSE)?
- RQ3通过从多语言文本编码器蒸馏训练的语音编码器,在跨语言和跨模态相似度搜索中能达到多高的性能?
- RQ4与监督基线模型(如 Whisper)相比,Sonar 框架在零样本语音到文本翻译中的有效性如何?
- RQ5结合多种目标对学习到的句子表征在多样化语言和模态下的泛化能力和鲁棒性有何影响?
主要发现
- Sonar 文本编码器在 xsim 和 xsim++ 多语言相似度搜索基准上优于现有模型(如 Laser3 和 LabSE),证明了其优越的与语言无关的句子表征能力。
- 该模型在零样本文本到文本翻译中表现具有竞争力,尽管使用了固定大小的瓶颈,仍可与最先进模型 NLLB 1B 相媲美。
- 在零样本语音到文本翻译方面,Sonar 在 Fleurs 测试集上的平均 BLEU 分数高于 Whisper v2 large,尤其在印地语、孟加拉语和泰米尔语等印度语言上表现尤为出色。
- 翻译和 MSE 损失的结合显著提升了跨语言对齐效果,而过度去噪会降低与语言无关表征的质量。
- 通过教师-学生蒸馏训练的语音编码器在跨模态相似度搜索中表现强劲,证实了文本和语音嵌入在统一空间中的兼容性。
- Sonar 框架能够有效实现跨语言和模态组合的零样本解码,相关开源模型可供研究和部署使用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。