Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous speech separation: dataset and analysis

Zhuo Chen, Takuya Yoshioka|arXiv (Cornell University)|2020. 01. 30.
Speech and Audio Processing참고 문헌 36인용 수 11
한 줄 요약

이 논문은 실생활의 다중 채널 환경에서 연속적인 겹침 음성 상황을 시뮬레이션하는 LibriCSS라는 데이터셋을 소개하고, 연속 음성 분離(CSS)을 위한 Kaldi 기반의 ASR 평가 프로토콜을 수립한다. 조건이 엄격한 실험실 벤치마크와는 달리, 고도로 겹쳐진 음성과 제한된 마이크 수에서조차도 고급 CSS 방법이 성능 저하를 겪는다는 점을 입증하며, 실험실 평가와 실제 응용 간 격차를 드러낸다.

ABSTRACT

This paper describes a dataset and protocols for evaluating continuous speech separation algorithms. Most prior studies on speech separation use pre-segmented signals of artificially mixed speech utterances which are mostly \emph{fully} overlapped, and the algorithms are evaluated based on signal-to-distortion ratio or similar performance metrics. However, in natural conversations, a speech signal is continuous, containing both overlapped and overlap-free components. In addition, the signal-based metrics have very weak correlations with automatic speech recognition (ASR) accuracy. We think that not only does this make it hard to assess the practical relevance of the tested algorithms, it also hinders researchers from developing systems that can be readily applied to real scenarios. In this paper, we define continuous speech separation (CSS) as a task of generating a set of non-overlapped speech signals from a extit{continuous} audio stream that contains multiple utterances that are \emph{partially} overlapped by a varying degree. A new real recorded dataset, called LibriCSS, is derived from LibriSpeech by concatenating the corpus utterances to simulate a conversation and capturing the audio replays with far-field microphones. A Kaldi-based ASR evaluation protocol is also established by using a well-trained multi-conditional acoustic model. By using this dataset, several aspects of a recently proposed speaker-independent CSS algorithm are investigated. The dataset and evaluation scripts are available to facilitate the research in this direction.

연구 동기 및 목표

  • 연속적이며 부분적으로 겹쳐진 음성으로 구성된 실생활 대화 응용 프로그램과 실험실 기반의 음성 분리 벤치마크 간의 괴리를 해소하기 위해.
  • 사전 분할된 데이터셋과 신호 기반 메트릭(예: SDR, SISNR)이 ASR 정확도와 잘 연관되지 않는 한계를 극복하기 위해.
  • 겹침 감지, 화자 다이어라이제이션, 종단 간 ASR 성능을 포함한 실질적인 연속 음성 분리(CSS) 평가 프레임워크를 개발하기 위해.
  • 실제 기록 기반 데이터셋을 사용하여 마이크 구성과 지연 시간이 CSS 성능에 미치는 영향을 조사하기 위해.
  • 음성 분리 연구와 실질적 구현 간 격차를 해소하기 위해, 다양한 겹침 비율을 가진 연속 오디오 스트림에서 시스템을 평가하기 위해.

제안 방법

  • 실제 실내에서 원거리 마이크를 사용해 LibriSpeech 발화문을 연결하여 연속적인 회의 유사 오디오로 구성된 LibriCSS를 제작한다.
  • 화자 독립적 음성 분리 모델을 기반으로 한 순열 불변 훈련(PIT)을 사용해 연속 혼합 오디오에서 겹침이 없는 음성 스트림을 생성한다.
  • 다중 조건 기반 음향 모델을 사용한 Kaldi 기반의 ASR 파ipeline를 구현하여 연속 입력에서 단어 오류율(WER)을 통해 분리 성능을 평가한다.
  • 겹침 비율(0%에서 40%까지)과 다양한 마이크 구성(1채널에서 7채널까지), 공간 배열(선형, 삼각형, 원형)을 다양하게 설정하여 평가한다.
  • 앞서보기(lookahead)를 포함한 청크 기반 추론을 적용해 실시간 처리를 시뮬레이션하고 내재된 지연 시간을 측정한다.
  • MVDR 빔포밍을 기준선으로 삼고, 마스크 기반 분리 및 분리 없음 조건과 비교하여 CSS가 후속 ASR에 미치는 영향을 분리 분석한다.
Fig. 1 : Example recording setup (left) and microphone array geometry (right).
Fig. 1 : Example recording setup (left) and microphone array geometry (right).

실험 결과

연구 질문

  • RQ1실생활 유사 오디오 스트림에서 겹침 비율이 증가함에 따라 연속 음성 분리 성능은 어떻게 변하는가?
  • RQ2연속 음성 분리 시스템을 사용할 때 마이크 수와 공간 배열이 후속 ASR의 WER에 어느 정도의 영향을 미치는가?
  • RQ3화자 독립적 CSS 시스템은 겹침이 없는 세그먼트에서 ASR 성능을 유지하거나 향상시킬 수 있는가? 그리고 왜곡을 유발하는가?
  • RQ4앞서보기와 청크 기반 처리에서 기인하는 내재된 처리 지연 시간이 연속 입력 환경에서 ASR 성능에 어떤 영향을 미치는가?
  • RQ5대화 간 간격이 3초에서 0.5초 이하로 줄어들었을 때, 음성 분리가 WER에 미치는 상대적 영향은 어떠한가?

주요 결과

  • 대화 간 간격이 3초(0L)에서 0.5초 이하(0S)로 줄어들었을 때, 분리 없이 처리하는 기준선의 WER이 33.9% 상승했다. 이는 침묵이 없는 전환 구조가 ASR 성능에 악영향을 준다는 것을 시사한다.
  • CSS 시스템은 짧은 간격으로 인한 WER 상승률을 22.7%로 낮춰, 분리 기술이 인접한 발화로 인한 성능 저하를 완화시킨다는 것을 입증한다.
  • 일곱 개의 마이크를 사용할 경우, 40% 겹침 상황에서 분리 없이 처리했을 때의 WER 43.3%가 CSS 시스템으로 21.9%로 감소하여 고도로 겹쳐진 상황에서도 뚜렷한 성능 향상을 보였다.
  • 단일 채널 및 세 마이크 시스템은 겹침이 없는 세그먼트에서 WER가 악화되는 경우가 많았으며, 이는 불필요한 빔포밍 또는 분리가 왜곡을 유발할 수 있음을 시사한다.
  • 앞서보기(예: 1.2-0.8-0.4)를 적용한 시스템은 그렇지 않은 시스템(예: 1.6-0.8-0.0)보다 성능이 뛰어나, 향후 정보가 더 나은 분리 품질을 제공한다는 것을 보여준다.
  • 세 마이크 선형 배열은 40% 겹침 상황에서 WER 30.1%를 기록했고, 삼각형 배열은 36.0%를 기록하여 공간 배열이 성능에 상당한 영향을 미친다는 점을 입증한다.
Fig. 2 : Generating TF masks in a streaming fashion by using a sliding window. Output orders for each pair of neighboring chunks are aligned by using the frames that the two chunks share.
Fig. 2 : Generating TF masks in a streaming fashion by using a sliding window. Output orders for each pair of neighboring chunks are aligned by using the frames that the two chunks share.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.