Skip to main content
QUICK REVIEW

[论文解读] LLaSM: Large Language and Speech Model

Yu Shu, Siwei Dong|arXiv (Cornell University)|Aug 30, 2023
Multimodal Machine Learning Applications被引用 5
一句话总结

LLaSM 是一个大规模、端到端训练的多模态语音与语言模型,可直接理解并响应中文和英文的语音指令。通过将冻结的 Whisper 编码器生成的语音嵌入与文本嵌入通过可学习的模态适配器融合,LLaSM 实现了无需语音转文本转换的跨模态指令遵循,其背后依托新发布的 LLaSM-Audio-Instructions 数据集,包含 508,000 个语音-文本样本。

ABSTRACT

Multi-modal large language models have garnered significant interest recently. Though, most of the works focus on vision-language multi-modal models providing strong capabilities in following vision-and-language instructions. However, we claim that speech is also an important modality through which humans interact with the world. Hence, it is crucial for a general-purpose assistant to be able to follow multi-modal speech-and-language instructions. In this work, we propose Large Language and Speech Model (LLaSM). LLaSM is an end-to-end trained large multi-modal speech-language model with cross-modal conversational abilities, capable of following speech-and-language instructions. Our early experiments show that LLaSM demonstrates a more convenient and natural way for humans to interact with artificial intelligence. Specifically, we also release a large Speech Instruction Following dataset LLaSM-Audio-Instructions. Code and demo are available at https://github.com/LinkSoul-AI/LLaSM and https://huggingface.co/spaces/LinkSoul/LLaSM. The LLaSM-Audio-Instructions dataset is available at https://huggingface.co/datasets/LinkSoul/LLaSM-Audio-Instructions.

研究动机与目标

  • 开发一个通用人工智能助手,能够理解并响应自然的多模态对话中的语音指令。
  • 解决在多语言环境下缺乏大规模开源语音-文本指令遵循数据集的问题。
  • 实现在无需依赖自动语音识别(ASR)作为预处理步骤的前提下,对语音输入进行端到端处理。
  • 通过支持直接、自然且高效的中英文语音交互,提升人机交互体验。
  • 构建一个资源高效框架,利用预训练组件(Whisper、LLaMA)并仅进行最小程度的微调。

提出的方法

  • 训练一个模态适配器,将冻结的 Whisper 编码器生成的语音嵌入与冻结的 LLaMA 模型生成的文本嵌入对齐。
  • 将语音和文本嵌入拼接为交错序列,并输入大语言模型进行有监督微调。
  • 训练分为两个阶段:首先使用公开的 ASR 数据集进行模态适配预训练,随后在语音-文本指令数据上进行跨模态指令微调。
  • LLaSM-Audio-Instructions 数据集通过筛选高质量的纯文本指令数据,并利用文本到语音(TTS)技术生成语音构建而成。
  • 在指令微调过程中,模型端到端进行微调,冻结语音编码器,仅更新模态适配器和大语言模型参数。
  • 该方法通过直接处理原始音频信号在多模态序列中的方式,避免了 ASR 流程中的信息损失。

实验结果

研究问题

  • RQ1大语言模型能否在不依赖语音转文本转换的前提下,有效微调以理解并响应语音指令?
  • RQ2模态适配器在对齐预训练语音与文本嵌入以实现跨模态指令遵循方面效果如何?
  • RQ3大规模多语言语音-文本指令数据集对多模态大语言模型性能有何影响?
  • RQ4采用冻结编码器与轻量级适配器的资源高效训练策略,能否在语音与语言指令遵循任务中实现优异性能?
  • RQ5该模型在跨语言场景下的泛化能力如何,特别是在中文等低资源语言设置下?

主要发现

  • LLaSM 实现了无需中间 ASR 步骤的直接语音与语言指令遵循,减少了错误传播与信息损失。
  • 该模型展现出强大的双语能力,对中文和英文语音输入均能生成高流利度与相关性的响应。
  • LLaSM-Audio-Instructions 数据集包含 199,000 场对话与 508,000 个样本,是目前公开的规模最大、涵盖中英文的语音-文本指令遵循数据集。
  • 两阶段训练策略——模态适配预训练后接指令微调——实现了高效参数更新,计算成本极低。
  • 模型在零样本与少样本设置下表现稳健,表明其在多样化语音与语言指令上具有强大的泛化能力。
  • 将冻结的 Whisper 编码器与微调后的模态适配器及大语言模型结合,实现了高质量、端到端的多模态理解,且仅需极少再训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。