Skip to main content
QUICK REVIEW

[논문 리뷰] Brouhaha: multi-task training for voice activity detection, speech-to-noise ratio, and C50 room acoustics estimation

Marvin Lavechin, Marianne Métais|arXiv (Cornell University)|2022. 10. 24.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

Brouhaha는 단일 채널 음성에서 음성 활성 검출, 음성 대 잡음 비율(SNR), C50 실내 음향을 동시에 예측하는 다중 작업 딥러닝 모델을 제안한다. 합성된 오염된 데이터로 훈련된 이 모델은 1,250시간의 합성 음성 데이터를 기반으로 하며, 실제 환경 데이터에서 뛰어난 성능을 보이며, 다중 작업 훈련이 일반화 능력을 향상시키고, 열악한 음향 조건에서 ASR 및 다이아라이제이션 시스템의 신뢰성 분석을 실용적으로 가능하게 한다.

ABSTRACT

Most automatic speech processing systems register degraded performance when applied to noisy or reverberant speech. But how can one tell whether speech is noisy or reverberant? We propose Brouhaha, a neural network jointly trained to extract speech/non-speech segments, speech-to-noise ratios, and C50room acoustics from single-channel recordings. Brouhaha is trained using a data-driven approach in which noisy and reverberant audio segments are synthesized. We first evaluate its performance and demonstrate that the proposed multi-task regime is beneficial. We then present two scenarios illustrating how Brouhaha can be used on naturally noisy and reverberant data: 1) to investigate the errors made by a speaker diarization model (pyannote.audio); and 2) to assess the reliability of an automatic speech recognition model (Whisper from OpenAI). Both our pipeline and a pretrained model are open source and shared with the speech community.

연구 동기 및 목표

  • 단일 채널 음성에서 음성 활성, SNR, 실내 음향(C50)을 사전 분할 또는 RIR이 없이 추정하는 통합 시스템을 개발하는 것.
  • 단일 작업 기반 모델 대비 다중 작업 훈련이 음성 활성 검출, SNR, C50 추정 성능에 미치는 영향을 조사하는 것.
  • 예측된 음향 지표를 활용해 실제 소음 및 반향 조건에서 ASR 및 화자 다이아라이제이션 시스템의 신뢰성에 대한 실용적 분석을 가능하게 하는 것.
  • 비전문가가 쉽게 사용할 수 있는 오픈소스 도구를 제공하여 음성 데이터 품질과 시스템 내성 평가를 가능하게 하는 것.

제안 방법

  • 청결한 음성과 잡음 세그먼트를 무작위로 선택된 실내 임펄스 응답(RIR)으로 컨볼루션한 후, 0~30 dB 사이의 임의의 SNR로 혼합하여 합성 음성을 생성한다.
  • 이러한 합성 데이터 1,250시간에 대해 엔드 투 엔드로 훈련된 모델은 세 가지 작업을 수행한다: 음성/비음성 분류, 프레임 단위 SNR 회귀, C50 회귀.
  • 슬라이딩 윈도우 방식을 사용해 2초 세그먼트 동안 10ms 간격으로 SNR를 계산하여 국소적인 SNR 변화를 포착함으로써 비정적 잡음에 대한 내성을 향상시킨다.
  • 모델은 VAD, SNR, C50 예측를 위한 작업별 헤드를 갖춘 공유 인코더를 사용하여 파라미터 공유와 공동 최적화를 가능하게 한다.
  • 훈련 목표는 VAD에 대해 교차 엔트로피, SNR 및 C50 회귀에 대해 평균 제곱오차를 조합하며, 과도한 태스크 지배를 방지하기 위해 가중치를 균형 있게 조정한다.
  • 실제 데이터에서 두 가지 응용 사례를 통해 시스템을 평가한다: 미리 훈련된 화자 다이아라이제이션 시스템(pyannote.audio)의 오류 분석과 예측 지표를 활용한 ASR 신뢰성 평가(Whisper).

실험 결과

연구 질문

  • RQ1RIR이 없거나 사전 분할이 없이도 단일 신경망이 단일 채널 음성에서 음성 활성, SNR, C50를 동시에 효과적으로 예측할 수 있는가?
  • RQ2다중 작업 훈련이 단일 작업 기반 모델 대비 VAD, SNR, C50 추정 성능 향상에 기여하는가?
  • RQ3합성 데이터로 훈련된 모델이 실제 소음 및 반향 조건의 음성에 일반화되어 실용적 시스템 평가에 활용될 수 있는가?
  • RQ4예측된 SNR 및 C50 값이 다이아라이제이션 및 ASR과 같은 후속 시스템의 실제 성능 저하와 얼마나 관련이 있는가?

주요 결과

  • Brouhaha는 보류된 테스트 세트에서 예측된 C50 값과 진짜 C50 값 간 상관계수(R² = 0.85)를 달성했으며, 평균 절대 오차는 1.1 dB였다.
  • 다중 작업 훈련이 일반화 능력과 모든 세 가지 작업의 성능 향상에 기여함을 입증했다.
  • 저-SNR 및 저-C50 조건에서 화자 다이아라이제이션 오류(특히 화자 혼동)가 예측된 Brouhaha의 결과와 함께 유의미하게 증가했다.
  • Whisper의 단어 변환 정확도는 고-SNR 영역([12,24] dB)에서 83%에서 저-SNR 영역([-9,-4] dB)으로 떨어져 38%로 감소했으며, 이는 소음 조건에서의 신뢰성 저하를 확인한다.
  • 모델은 실제 데이터에서 문제 있는 음성 세그먼트를 성공적으로 식별하여 수동 애너테이션 없이도 시스템 실패 원인을 대상으로 분석할 수 있도록 했다.
  • 오픈소스 Brouhaha 파이프라인과 미리 훈련된 모델을 통해 연구자들은 단일 명령줄 인터페이스를 통해 음향 조건과 시스템 내성 평가를 쉽게 수행할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.