[论文解读] FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech
FLEURS 在 102 种语言中引入了一个多语言、n 方并行的语音与文本基准,基于 FLoRes-101 构建,包含人工验证的录音和高质量转录文本。该基准支持通用语音表征的少样本评估,在使用 mSLAM 的情况下,语音到文本检索的 P@1 达到 76.9%,文本到语音检索的 P@1 达到 74.4%,展现出在多种语言中强大的零样本和跨语言能力。
We introduce FLEURS, the Few-shot Learning Evaluation of Universal Representations of Speech benchmark. FLEURS is an n-way parallel speech dataset in 102 languages built on top of the machine translation FLoRes-101 benchmark, with approximately 12 hours of speech supervision per language. FLEURS can be used for a variety of speech tasks, including Automatic Speech Recognition (ASR), Speech Language Identification (Speech LangID), Translation and Retrieval. In this paper, we provide baselines for the tasks based on multilingual pre-trained models like mSLAM. The goal of FLEURS is to enable speech technology in more languages and catalyze research in low-resource speech understanding.
研究动机与目标
- 为低资源语言中的少样本学习解决大规模、高质量、多语言语音与文本数据集缺乏的问题。
- 支持在多样化的语系和低资源环境下对通用语音表征进行评估。
- 支持多种任务,包括自动语音识别(ASR)、语音语言识别(Speech Language Identification)、语音翻译和跨语言检索。
- 通过提供具有严格质量控制的标准化基准,推动数据高效、多语言语音理解的研究。
提出的方法
- 通过从 FLoRes-101 开发集和开发测试集中的每句话收集三段人工录制的语音,构建 FLEURS,确保性别比例均衡。
- 实施严格的质量控制:每段录音均由人工标注者验证,确保与原文一致,不匹配的录音将被剔除。
- 保留原始音频,不进行数据增强(如不使用 SpecAugment 或速度扰动),以保持真实世界中的变异性。
- 在 FLEURS 上微调多语言模型——mSLAM(0.6B)和 w2v-BERT,用于下游任务,包括 ASR、语音语言识别(Speech LangID)和跨模态检索。
- 在检索任务中,使用添加边距的 softmax 损失和批内负样本采样,训练基于交叉注意力的跨模态嵌入。
- 通过语音到文本和文本到语音检索的 P@1 分数评估检索性能,包括零样本和未见语言的泛化能力。

实验结果
研究问题
- RQ1像 mSLAM 这类多语言预训练模型在少样本语音理解任务中,对低资源和未见语言的泛化能力如何?
- RQ2与自动对齐或合成数据相比,人工验证的、n 方并行的语音与文本数据在质量和多样性上的提升,能在多大程度上改善少样本学习性能?
- RQ3在跨语言语音到文本和文本到语音检索中,模型性能在不同语系和语言组(如 CJK、南亚、欧洲)中如何变化?
- RQ4由于分词不匹配或语音相似性,预训练模型在低资源或书写系统差异较大的语言(如 Odia、Urdu)中的失败模式是什么?
- RQ5一个统一的多语言表征模型能否有效支持 ASR、语音语言识别(Speech LangID)和跨模态检索等多样化任务?
主要发现
- 使用 mSLAM 时,FLEURS 在语音到文本检索中达到平均 P@1 76.9%,在文本到语音检索中达到 74.4%,展现出强大的零样本和跨语言能力。
- 在 CJK 语言中性能显著下降(如语音到文本检索中 P@1 仅为 4.7%),主要原因是预训练与微调数据之间的分词不匹配。
- Odia(or)等语言在文本到语音检索中表现较差,尽管其语音数据存在,但因未出现在文本预训练语料(MC4)中,凸显了数据不平衡问题。
- Urdu(ur)在文本到语音检索中的表现劣于语音到文本检索,可能由于其与其他南亚语言的语音相似性,导致在缺乏语音特定预训练的情况下难以区分。
- 在所有任务中,已见语言的性能始终优于未见语言,其中南亚(SA)和东南亚(SEA)语言组的性能差距最大。
- mSLAM 模型在所有任务中均优于 w2v-BERT,包括在语音语言识别中达到 73.4% 的 F1 分数,在语音到文本检索中达到 87.8% 的性能,表明联合语音-文本预训练的优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。