Skip to main content
QUICK REVIEW

[논문 리뷰] Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition

Ye Bai, Jingping Chen|arXiv (Cornell University)|2024. 07. 05.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

Seed-ASR는 다국어, 다언어, 다양한 억양 및 도메인을 포함한 다양한 말하기 유형에서 인식 성능을 향상시키기 위해 음성 조건부 대규모 언어 모델(AcLLM) 아키텍처를 활용하는 대규모 언어 모델(LLM) 기반 음성 인식 시스템을 제안한다. 연속적인 말하기 표현과 맥락 정보를 통합하고, 자기지도 사전학습, 지도 미세조정, 맥락 인식 미세조정, 강화학습을 포함하는 단계별 훈련 절차를 적용함으로써, 공개 및 내부 벤치마크에서 최신 기술 대비 상대적으로 10%-40%의 단어 오류율(WER) 감소를 달성한다.

ABSTRACT

Modern automatic speech recognition (ASR) model is required to accurately transcribe diverse speech signals (from different domains, languages, accents, etc) given the specific contextual information in various application scenarios. Classic end-to-end models fused with extra language models perform well, but mainly in data matching scenarios and are gradually approaching a bottleneck. In this work, we introduce Seed-ASR, a large language model (LLM) based speech recognition model. Seed-ASR is developed based on the framework of audio conditioned LLM (AcLLM), leveraging the capabilities of LLMs by inputting continuous speech representations together with contextual information into the LLM. Through stage-wise large-scale training and the elicitation of context-aware capabilities in LLM, Seed-ASR demonstrates significant improvement over end-to-end models on comprehensive evaluation sets, including multiple domains, accents/dialects and languages. Additionally, Seed-ASR can be further deployed to support specific needs in various scenarios without requiring extra language models. Compared to recently released large ASR models, Seed-ASR achieves 10%-40% reduction in word (or character, for Chinese) error rates on Chinese and English public test sets, further demonstrating its powerful performance.

연구 동기 및 목표

  • 다국어, 다언어, 억양, 다양한 도메인을 포함한 다양한 말하기 입력을 처리할 수 있는 더 정확하고 일반화 능력이 뛰어난 ASR 시스템을 개발하기 위해.
  • 외부 언어 모델에 크게 의존하고 맥락 추론 및 도메인 외 일반화에 어려움을 겪는 엔드 투 엔드 ASR 모델의 한계를 극복하기 위해.
  • 대규모 언어 모델(LLM)의 추론 및 지식 능력을 음성 조건부 LLM(AcLLM) 프레임워크 내에서 활용하여 번역 정확도와 맥락 인식 능력을 향상시키기 위해.
  • 추가 언어 모델이 필요 없이 다양한 응용 시나리오에 통합적이고 사용자 정의 가능한 배포를 가능하게 하기 위해.
  • 자기지도 학습, 지도 미세조정, 맥락 인식 적응, 강화학습을 통합한 확장 가능한 단계별 훈련 절차를 수립하여 모델 성능을 점진적으로 향상시키기 위해.

제안 방법

  • 모델은 원시 음성 입력에서 연속적인 말하기 표현을 추출하기 위해 약 20억 파라미터를 갖는 음성 인코더를 사용한다.
  • 이 표현들은 텍스트 맥락(예: 대화 이력, 영상 편집 맥락 등)과 융합되어 수십십억 파라미터를 갖는 믹스처 오브 응용 프로그램(MoE) LLM에 입력된다.
  • 이 프레임워크는 LLM이 음성 특징과 맥락 프롬프트에 조건부로 다음 토큰 예측을 수행하는 음성 조건부 LLM(AcLLM) 패러다임을 따르며.
  • 단계별 훈련 절차가 적용된다: (1) 2000만 시간 이상의 원시 음성에서의 자기지도 사전학습, (2) 쌍화된 ASR 데이터에서의 지도 미세조정, (3) 풍부한 맥락 신호를 사용한 맥락 인식 미세조정, (4) 참조 번역과 일치하도록 모델 출력을 최적화하는 강화학습.
  • 맥락 인식 미세조정은 미팅 이력이나 대화 흐름과 같은 회귀 맥락 신호 간의 의존성을 모델링하여 关련 키워드 복귀율을 명시적으로 향상시킨다.
  • 강화학습은 참조 번역과 일치하는 보상 모델을 사용하여, 의미적으로 중요한 구문에 대해 번역 품질을 최적화한다.

실험 결과

연구 질문

  • RQ1LLM 기반 ASR 시스템은 저자원 언어 및 지역 방언을 포함한 다양한 말하기 유형을 인식하는 데 있어 엔드 투 엔드 모델을 상당히 능가할 수 있는가?
  • RQ2맥락 인식 미세조정은 대화형 및 다단계 설정에서 키워드 복귀율과 번역 일관성에 얼마나 기여하는가?
  • RQ3자기지도 학습, 지도 미세조정, 맥락 적응, 강화학습을 통합한 단계별 훈련 절차는 ASR에 얼마나 효과적인가?
  • RQ4통합된 LLM 기반 아키텍처는 별도의 언어 모델이 필요 없이 다양한 도메인과 언어에서 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5복잡한 음향적 및 의미적 변형을 포함한 장기형 음성 및 예측 불가능한 도메인에 대해 모델은 어떻게 일반화되는가?

주요 결과

  • Seed-ASR (ML)은 영어 다도메인 평가 세트에서 5.34%의 WER를 기록하여 가장 강력한 베이스라인인 Whisper Large-v3(10.41% WER) 대비 49% 상대적 감소를 달성했다.
  • 영어 다양한 억양 및 어려운 케이스 평가 세트에서 Seed-ASR (ML)은 11.26%의 WER와 87.94%의 F1 스코어를 기록했으며, Whisper Large-v3(21.52% WER, 79.54% F1)와 Google USM(22.19% WER, 63.30% F1)을 모두 능가했다.
  • 다국어 다도메인 평가 세트에서 Seed-ASR (ML)은 12.16%의 WER를 기록했으며, 가장 강력한 베이스라인인 Whisper Large-v3(20.55% WER) 대비 42% 상대적 향상도 달성했다.
  • 공개 테스트 세트에서 Seed-ASR (ML)은 14개 언어에서 최신 기술 성능을 기록했으며, Librispeech test-clean에서 1.58% WER, test-other에서 2.84%, Tedlium 3에서 3.11%를 기록하여 모든 보고된 베이스라인을 초월했다.
  • 아랍어(13.05% WER), 스페인어(2.50% WER), 일본어(3.46% WER)와 같은 저자원 언어에서도 Seed-ASR (ML)은 강력한 일반화 능력과 경쟁력 있는 성능를 보였다.
  • 맥락 인식 미세조정 단계는 대화형 및 맥락이 풍부한 상황에서 키워드 복귀율을 크게 향상시켜, 모델이 맥락 정보를 효과적으로 활용할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.