Skip to main content
QUICK REVIEW

[论文解读] AudioBench: A Universal Benchmark for Audio Large Language Models

Bin Wang, Xunlong Zou|arXiv (Cornell University)|Jun 23, 2024
Music and Audio Processing被引用 4
一句话总结

AudioBench 是一个全面的基准测试,用于在 8 种不同的任务和 26 个数据集上评估音频大语言模型(AudioLLMs),涵盖语音理解、语音特征解析和音频场景分析。该基准测试使用标准化提示、多样化的输入长度和新颖的评估指标,对四种开源模型进行评估,发现没有一个模型在所有任务上都表现卓越,凸显了 AudioLLM 能力仍有显著的提升空间。

ABSTRACT

We introduce AudioBench, a universal benchmark designed to evaluate Audio Large Language Models (AudioLLMs). It encompasses 8 distinct tasks and 26 datasets, among which, 7 are newly proposed datasets. The evaluation targets three main aspects: speech understanding, audio scene understanding, and voice understanding (paralinguistic). Despite recent advancements, there lacks a comprehensive benchmark for AudioLLMs on instruction following capabilities conditioned on audio signals. AudioBench addresses this gap by setting up datasets as well as desired evaluation metrics. Besides, we also evaluated the capabilities of five popular models and found that no single model excels consistently across all tasks. We outline the research outlook for AudioLLMs and anticipate that our open-sourced evaluation toolkit, data, and leaderboard will offer a robust testbed for future model developments.

研究动机与目标

  • 为解决当前在多样化音频理解任务中缺乏全面、统一的基准测试以评估音频大语言模型(AudioLLMs)的问题。
  • 提供一个标准化的评估框架,包含多样化数据集、提示模板和输入长度,以确保公平且全面的模型对比。
  • 开发可靠且成本低廉的评估指标,用于开放式音频生成任务,减少对昂贵或不稳定的 LLM 判官(如 GPT-4)的依赖。
  • 通过在真实世界、指令遵循型音频任务上测试现有 AudioLLMs,识别其性能差距。
  • 建立一个公开、开源的测试平台,提供代码、数据和排行榜,以加速未来 AudioLLM 领域的研究与开发。

提出的方法

  • 该基准测试包含 8 项核心任务:语音理解、音频场景理解、语音理解、语音指令、音频字幕生成、口音识别、性别识别和情绪识别。
  • 整合了 26 个数据集——其中 7 个为新整理或适配的数据集——涵盖语音、环境声音、副语言特征以及多模态音频-文本交互。
  • 评估使用标准化的提示模板,并将输入长度从几秒到几分钟不等,以测试长上下文处理能力。
  • 该基准测试包含超过 400 小时的音频和 10 万个以上的样本,支持对模型进行全面评估。
  • 采用自动评估指标(如 WER、METEOR)和人工参与的“模型作为裁判”评估方式(如 LLaMA-3-8B-Instruct),以评估开放式生成的质量。
  • 本研究对比了四种开源模型:Whisper+Llama3、SALMONN、Qwen-Audio 和 WavLLM,涵盖端到端和级联式架构。

实验结果

研究问题

  • RQ1现有 AudioLLMs 在多样化音频理解任务(包括语音、语音特征和环境声音理解)中的泛化能力如何?
  • RQ2在不同类型的音频输入和长度下,端到端与级联式 AudioLLM 架构之间的性能差距有多大?
  • RQ3开源的“模型作为裁判”方法(如 LLaMA-3)在评估 AudioLLM 输出方面,与 GPT-4 相比效果如何?其与人类判断的相关性如何?
  • RQ4哪些数据集和评估指标最能反映 AudioLLM 在真实世界指令遵循任务中的能力?
  • RQ5当前 AudioLLMs 在面对复杂、多模态音频输入时,其关键局限和失效模式是什么?

主要发现

  • 没有一个 AudioLLM 在全部 8 项任务中均表现优异,表明其泛化能力和鲁棒性仍有显著提升空间。
  • Whisper+Llama3 级联模型在多项 ASR 任务中优于端到端模型,在 LibriSpeech-Clean 数据集上 WER 达 1.83,凸显模块化设计的价值。
  • LLaMA-3-8B-Instruct 与 GPT-4 作为裁判的相关性高于 Prometheus-2,表明其作为更可靠且成本更低的评估代理更具优势。
  • 在使用 LLaMA-3 模型作为裁判时,WavCaps 和 AudioCaps 数据集在音频字幕生成任务中表现优异,METEOR 分别达到 21.36 和 22.79。
  • 在情绪与情感识别任务(如 IEMOCAP-Emotion、MELD)中,模型表现中等,M.J.8B 尺度上的得分约为 1.5,表明在副语言理解方面仍面临挑战。
  • 该基准测试揭示,当前模型在长时音频输入上表现不佳,如在 Tedlium3-Longform 上 WER 高达 25.88,表明其在上下文保留方面存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。