Skip to main content
QUICK REVIEW

[논문 리뷰] AudioBench: A Universal Benchmark for Audio Large Language Models

Bin Wang, Xunlong Zou|arXiv (Cornell University)|2024. 06. 23.
Music and Audio Processing인용 수 4
한 줄 요약

AudioBench는 음성 이해, 음성 해석, 음향 환경 분석을 포함한 8개의 다양한 작업과 26개의 데이터셋을 통해 음성 대규모 언어 모델(AudioLLMs)을 평가하기 위한 종합적인 벤치마크입니다. 표준화된 프롬프트, 다양한 입력 길이, 그리고 새로운 평가 지표를 사용하여 4개의 오픈소스 모델을 평가한 결과, 어떤 모델도 모든 작업에서 뛰어난 성능를 보이지 않아 AudioLLM 능력 향상에 여전히 큰 여지가 있음을 시사합니다.

ABSTRACT

We introduce AudioBench, a universal benchmark designed to evaluate Audio Large Language Models (AudioLLMs). It encompasses 8 distinct tasks and 26 datasets, among which, 7 are newly proposed datasets. The evaluation targets three main aspects: speech understanding, audio scene understanding, and voice understanding (paralinguistic). Despite recent advancements, there lacks a comprehensive benchmark for AudioLLMs on instruction following capabilities conditioned on audio signals. AudioBench addresses this gap by setting up datasets as well as desired evaluation metrics. Besides, we also evaluated the capabilities of five popular models and found that no single model excels consistently across all tasks. We outline the research outlook for AudioLLMs and anticipate that our open-sourced evaluation toolkit, data, and leaderboard will offer a robust testbed for future model developments.

연구 동기 및 목표

  • 다양한 음향 이해 작업을 아우르는 종합적이고 통합된 벤치마크가 부족한 문제를 해결하기 위해.
  • 공정하고 종합적인 모델 비교를 보장하기 위해 다양한 데이터셋, 프롬프트 템플릿, 입력 길이를 포함한 표준화된 평가 프레임워크를 제공하기 위해.
  • GPT-4와 같은 비용이 많이 들거나 불안정한 LLM 심판에 의존하는 것을 줄이기 위해 개방형 평가 지표를 개발하여 신뢰성 있고 비용 효율적인 음성 생성 평가를 가능하게 하기 위해.
  • 실제 세계의 지시 준수 음성 작업을 통해 기존 AudioLLMs의 성능 격차를 파악하기 위해.
  • 코드, 데이터, 랭킹리스트를 포함한 공개적이고 오픈소스의 테스트베드를 구축하여 향후 AudioLLM 분야의 연구 및 개발을 가속화하기 위해.

제안 방법

  • 벤치마크는 8개의 핵심 작업을 포함합니다: 음성 이해, 음향 환경 이해, 음성 이해, 음성 지시, 음향 캡션, 어조 인식, 성별 인식, 감정 인식.
  • 7개의 신규로 선별하거나 변형한 데이터셋 포함 총 26개의 데이터셋을 통합하여 음성, 환경 소리, 부언적 특성, 다중모odal 음성-텍스트 상호작용을 포괄합니다.
  • 표준화된 프롬프트 템플릿을 사용하고 입력 길이를 초단위에서 분 단위까지 다양화하여 장기적 맥락 처리 능력을 테스트합니다.
  • 벤치마크는 400시간 이상의 음성 자료와 10만 건 이상의 샘플을 포함하여 종합적인 모델 평가를 가능하게 합니다.
  • 자동 평가 지표(예: WER, METEOR)와 인간이 개입하는 평가 방식(예: LLaMA-3-8B-Instruct를 심판으로 사용)을 병행하여 개방형 생성 품질을 평가합니다.
  • 엔드 투 엔드 아키텍처와 캐스케이드 아키텍처를 모두 사용한 4개의 오픈소스 모델(Whisper+Llama3, SALMONN, Qwen-Audio, WavLLM)을 비교 평가합니다.

실험 결과

연구 질문

  • RQ1기존 AudioLLMs는 음성, 음성, 환경 소리 이해를 포함한 다양한 음향 이해 작업에 얼마나 잘 일반화되는가?
  • RQ2다양한 음성 입력 유형과 길이에서 엔드 투 엔드 아키텍처와 캐스케이드 아키텍처 간의 성능 격차는 어떠한가?
  • RQ3LLaMA-3과 같은 오픈소스 모델을 심판으로 사용하는 접근 방식은 GPT-4에 비해 얼마나 효과적인가, 그리고 인간 판단과의 상관관계는 어떠한가?
  • RQ4어느 데이터셋과 평가 지표가 AudioLLMs의 실제 세계 지시 준수 능력을 가장 잘 반영하는가?
  • RQ5복잡한 다중모달 음성 입력에 직면했을 때 현재 AudioLLMs의 주요 제약 조건과 실패 유형은 무엇인가?

주요 결과

  • 모든 8개의 작업에서 뛰어난 성능를 보이는 단일 AudioLLM은 존재하지 않으며, 일반화 및 내성성 향상에 여전히 큰 개선 여지가 있음을 시사한다.
  • Whisper+Llama3 캐스케이드 모델은 여러 ASR 작업에서 엔드 투 엔드 모델을 능가하며, LibriSpeech-Clean에서 WER 1.83을 기록하여 모듈러 설계의 가치를 입증한다.
  • LLaMA-3-8B-Instruct는 Prometheus-2보다 GPT-4 심판과 더 높은 상관관계를 보이며, 더 신뢰할 수 있고 비용 효율적인 평가 대체 수단으로서 유용하다.
  • WavCaps와 AudioCaps 데이터셋은 LLaMA-3 모델을 심판으로 사용했을 때 각각 METEOR 점수 21.36과 22.79를 기록하여 음향 캡션 작업에서 뛰어난 성능를 보였다.
  • 감정 및 정서 인식 작업(예: IEMOCAP-Emotion, MELD)에서는 모델들이 중간 수준의 성능를 보이며, M.J.8B 척도 기준 약 1.5의 점수를 기록하여 부언적 특성 이해에 어려움을 겪고 있음을 시사한다.
  • 벤치마크는 현재 모델들이 장시간 음성 입력에서 어려움을 겪고 있음을 드러내며, Tedlium3-Longform에서 WER가 25.88로 높게 나타나 맥락 유지 능력에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.