Skip to main content
QUICK REVIEW

[논문 리뷰] Guided Source Separation Meets a Strong ASR Backend: Hitachi/Paderborn University Joint Investigation for Dinner Party ASR

Naoyuki Kanda, Christoph Boeddeker|arXiv (Cornell University)|2019. 05. 29.
Speech and Audio Processing참고 문헌 30인용 수 12
한 줄 요약

이 논문은 음성 강화를 위한 가이드드 소스 분리(GSS)와 강력한 ASR 백엔드를 밀접하게 통합하여 CHiME-5 딜라이트 파티 코퍼스용 최신 기술 수준의 음성 인식 시스템을 제시한다. 통합 시스템은 개발 데이터에서 39.94% WER, 평가 데이터에서 41.64% WER를 기록하여 지금까지 발표된 바 중 최고의 성능을 달성하였으며, 이는 이 작업의 어려움이 데이터 부족이 아니라 본질적인 음향적 과제에 기인함을 입증한다.

ABSTRACT

In this paper, we present Hitachi and Paderborn University's joint effort for automatic speech recognition (ASR) in a dinner party scenario. The main challenges of ASR systems for dinner party recordings obtained by multiple microphone arrays are (1) heavy speech overlaps, (2) severe noise and reverberation, (3) very natural conversational content, and possibly (4) insufficient training data. As an example of a dinner party scenario, we have chosen the data presented during the CHiME-5 speech recognition challenge, where the baseline ASR had a 73.3% word error rate (WER), and even the best performing system at the CHiME-5 challenge had a 46.1% WER. We extensively investigated a combination of the guided source separation-based speech enhancement technique and an already proposed strong ASR backend and found that a tight combination of these techniques provided substantial accuracy improvements. Our final system achieved WERs of 39.94% and 41.64% for the development and evaluation data, respectively, both of which are the best published results for the dataset. We also investigated with additional training data on the official small data in the CHiME-5 corpus to assess the intrinsic difficulty of this ASR task.

연구 동기 및 목표

  • 중복된 음성, 반향, 잡음 등으로 인해 매우 도전적인 상황인 CHiME-5 딜라이트 파티 시나리오에 최신 기술 수준의 ASR 시스템을 개발하기 위해.
  • CHiME-5에서 높은 WER가 데이터 부족 때문인지, 아니면 음향적 과제(예: 음성 중첩, 반향 등) 때문인지 조사하기 위해.
  • 이 어려운 환경에서 더 큰 학습 데이터가 음성 모델(AM)과 언어 모델(LM) 성능에 미치는 영향을 평가하기 위해.
  • 다중 화자, 잡음이 있는, 반향이 있는 환경에서 고급 음성 강화(GSS)와 강력한 ASR 백엔드를 조합하는 것이 효과적인지 입증하기 위해.

제안 방법

  • 공간 혼합 모델과 시간 레이블이 부여된 소스 활성도를 사용하여 GSS를 적용하여 비음향 기반의 목표 음성 및 왜곡 마스크를 추정하고, 비음향 기반의 비음향 처리를 수행하였다.
  • 반향 제거를 위해 WPE를 적용하고, MVDR 비음향 처리와 블라인드 분석 정규화 후처리 필터를 결합하여 강인한 소스 추출을 구현하였다.
  • GSS에서 생성된 음성 강화 결과를 CNN-TDNN-RBiLSTM 아키텍처 기반의 강력한 ASR 백엔드에 통합하고, LF-sMBR 학습을 적용하였다.
  • 공식 언어 모델를 사용하고, 개발 세트 튜닝을 통해 보정된 가중치를 조정하여 언어 모델 성능을 최적화하였다.
  • 더 큰 학습 데이터의 영향을 평가하기 위해, LibriSpeech 기반의 AM(960시간)을 학습하고, AMI와 LibriSpeech의 transcriptions를 조합하여 최대 1060만 단어의 언어 모델 사전 학습을 수행하였다.
  • 공식 CHiME-5 학습 데이터(40시간)를 사용한 분석 실험을 수행하고, 더 큰 규모의 데이터와의 비교를 통해 데이터 부족 효과를 분리하여 분석하였다.
Figure 2: Overview of CNN-TDNN-RBiLSTM acoustic model
Figure 2: Overview of CNN-TDNN-RBiLSTM acoustic model

실험 결과

연구 질문

  • RQ1가이드드 소스 분리와 강력한 ASR 백엔드를 밀접하게 통합하면 CHiME-5 딜라이트 파티 시나리오에서 WER가 크게 향상되는가?
  • RQ2CHiME-5에서 높은 WER는 주로 학습 데이터 부족 때문인지, 아니면 음성 중첩, 반향 등의 본질적인 음향적 과제 때문인가?
  • RQ3이 어려운 환경에서 비공식적인 대규모 코퍼스를 기반으로 학습된 더 큰 음성 모델과 언어 모델은 성능에 어떤 영향을 미치는가?
  • RQ4소음과 반향과 같은 심각한 환경 열화 조건이 존재할 경우, 더 큰 데이터 스케일에서의 성능 향상 효과가 점점 줄어드는가?

주요 결과

  • 통합 시스템은 개발 세트에서 39.94% WER, 평가 세트에서 41.64% WER를 기록하였으며, 이는 CHiME-5 데이터셋에 대해 지금까지 발표된 바 중 최고의 성능이다.
  • 960시간의 데이터로 훈련된 매우 강력한 LibriSpeech 기반의 AM를 사용한 결과, WER는 여전히 62.09%에 머물러 있어, 데이터 크기만으로는 핵심 과제를 해결할 수 없음을 시사한다.
  • LibriSpeech와 AMI 코퍼스에서 유래한 총 1060만 단어의 데이터로 훈련된 최고의 언어 모델은 기준 모델 대비 WER를 0.93% 뿐 감소시켜, 더 큰 언어 모델 데이터의 이점이 제한적임을 나타낸다.
  • CHiME-5 작업의 본질적 곤란성은 주로 음성 중첩, 반향, 잡음 등의 음향 조건 때문이며, 데이터 부족 때문이 아니라는 점을 입증한다.
  • GSS와 강력한 ASR 백엔드의 조합은 기준 시스템보다 유의미하게 뛰어난 성능을 보였으며, 음성 강화 모듈과 인식 모듈 간의 종단 간 통합의 가치를 입증한다.
  • 결과적으로 현재의 ASR 시스템은 실제 다중 화자, 잡음이 있는 환경에서 인간 수준의 성능에 도달하지 못하고 있으며, 강인한 음성 인식 기술의 향후 연구가 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.