Skip to main content
QUICK REVIEW

[论文解读] Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition

Ye Bai, Jingping Chen|arXiv (Cornell University)|Jul 5, 2024
Speech Recognition and Synthesis被引用 4
一句话总结

Seed-ASR 提出了一种基于大语言模型(LLM)的自动语音识别系统,采用音频条件大语言模型(AcLLM)架构,以提升对多种语音类型(包括多语言、多方言、多口音和多领域)的识别性能。通过整合连续语音表征与上下文信息,并采用分阶段训练方案——自监督预训练、监督微调、上下文感知微调及强化学习——Seed-ASR 在公共和内部基准测试中相较最先进模型实现了 10%–40% 的相对词错误率(WER)降低。

ABSTRACT

Modern automatic speech recognition (ASR) model is required to accurately transcribe diverse speech signals (from different domains, languages, accents, etc) given the specific contextual information in various application scenarios. Classic end-to-end models fused with extra language models perform well, but mainly in data matching scenarios and are gradually approaching a bottleneck. In this work, we introduce Seed-ASR, a large language model (LLM) based speech recognition model. Seed-ASR is developed based on the framework of audio conditioned LLM (AcLLM), leveraging the capabilities of LLMs by inputting continuous speech representations together with contextual information into the LLM. Through stage-wise large-scale training and the elicitation of context-aware capabilities in LLM, Seed-ASR demonstrates significant improvement over end-to-end models on comprehensive evaluation sets, including multiple domains, accents/dialects and languages. Additionally, Seed-ASR can be further deployed to support specific needs in various scenarios without requiring extra language models. Compared to recently released large ASR models, Seed-ASR achieves 10%-40% reduction in word (or character, for Chinese) error rates on Chinese and English public test sets, further demonstrating its powerful performance.

研究动机与目标

  • 开发一种更准确且泛化能力更强的 ASR 系统,能够处理多种语音输入,如多语言、多方言、多口音和多领域场景。
  • 克服端到端 ASR 模型严重依赖外部语言模型、在上下文推理和域外泛化方面表现不佳的局限性。
  • 在音频条件大语言模型(AcLLM)框架中,利用大语言模型(LLM)的推理与知识能力,提升转录准确率与上下文感知能力。
  • 实现统一、可定制的部署,适用于多样化应用场景,无需额外语言模型。
  • 建立可扩展的分阶段训练方案,通过自监督学习、监督微调、上下文自适应和强化学习逐步提升模型性能。

提出的方法

  • 该模型使用一个约 20 亿参数的音频编码器,从原始音频输入中提取连续语音表征。
  • 这些表征与文本上下文(如对话历史、视频剪辑上下文)融合后,输入到一个拥有数百亿参数的专家混合(MoE)LLM 中。
  • 该框架遵循音频条件大语言模型(AcLLM)范式,即 LLM 在音频特征和上下文提示的联合条件下执行下一个词预测。
  • 采用分阶段训练方案:(1) 在超过 2000 万小时的原始音频上进行自监督预训练,(2) 在配对的 ASR 数据上进行监督微调,(3) 使用丰富的上下文信号进行上下文感知微调,(4) 通过强化学习对齐文本生成与准确转录目标。
  • 上下文感知微调通过建模语音内容与周围上下文线索(如会议历史或对话流程)之间的依赖关系,明确提升关键词召回率。
  • 强化学习通过奖励模型对齐模型输出与参考转录,优化转录质量,尤其针对语义关键短语。

实验结果

研究问题

  • RQ1基于 LLM 的 ASR 系统是否能在识别多样语音类型(包括低资源语言和区域方言)方面显著超越端到端模型?
  • RQ2在对话和多轮交互场景中,上下文感知微调在多大程度上能提升关键词召回率与转录一致性?
  • RQ3结合自监督学习、监督微调、上下文适应与强化学习的分阶段训练方案在 ASR 中的效率如何?
  • RQ4统一的基于 LLM 的架构是否能替代对独立语言模型的需求,同时在多语言、多领域场景中保持或提升性能?
  • RQ5该模型在未见领域和具有复杂声学与语义变化的长时语音上的泛化能力如何?

主要发现

  • Seed-ASR (ML) 在英语多领域评估集上实现 5.34% 的 WER,相较最强基线模型(Whisper Large-v3 的 10.41% WER)实现 49% 的相对降低。
  • 在英语多口音和高难度测试集上,Seed-ASR (ML) 实现 11.26% 的 WER 和 87.94% 的 F1 分数,优于 Whisper Large-v3(21.52% WER,79.54% F1)和 Google USM(22.19% WER,63.30% F1)。
  • 在多语言多领域评估集上,Seed-ASR (ML) 实现 12.16% 的 WER,相较最强基线(Whisper Large-v3 的 20.55% WER)实现 42% 的相对提升。
  • 在公开测试集上,Seed-ASR (ML) 在 14 种语言上均达到最先进性能,Librispeech test-clean 上为 1.58% WER,test-other 上为 2.84%,Tedlium 3 上为 3.11%,优于所有报告的基线模型。
  • 对于低资源语言如阿拉伯语(13.05% WER)、西班牙语(2.50% WER)和日语(3.46% WER),Seed-ASR (ML) 展现出强大的泛化能力与竞争力表现。
  • 上下文感知微调阶段显著提升了对话和上下文丰富场景中的关键词召回率,证明了模型有效利用上下文信息的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。