Skip to main content
QUICK REVIEW

[논문 리뷰] INTERSPEECH 2021 ConferencingSpeech Challenge: Towards Far-field Multi-Channel Speech Enhancement for Video Conferencing

Wei Rao, Yihui Fu|arXiv (Cornell University)|2021. 04. 02.
Speech and Audio Processing참고 문헌 30인용 수 7
한 줄 요약

이 논문은 실제 영상 회의 환경을 대상으로 한 원거리 다채널 음성 강화 도전 과제인 INTERSPEECH 2021 ConferencingSpeech 챌린지를 제시한다. 이 도전 과제는 12개의 실제 회의실에서 신규로 기록한 데이터셋을 사용하여 실시간 강화(단일 마이크 배열 기반)와 비실시간 강화(다중 분산 배열 기반)의 두 가지 과제를 제공한다. 기준 시스템은 채널 간 위상 차이와 3층 LSTM을 활용한 복소 비율 마스크 기반 딥러닝 모델로, 실시간 인자(real-time factor)가 0.0425이며 주관적 MOS 평가를 통해 음성 품질 향상이 효과적으로 이루어졌음을 입증하였다.

ABSTRACT

The ConferencingSpeech 2021 challenge is proposed to stimulate research on far-field multi-channel speech enhancement for video conferencing. The challenge consists of two separate tasks: 1) Task 1 is multi-channel speech enhancement with single microphone array and focusing on practical application with real-time requirement and 2) Task 2 is multi-channel speech enhancement with multiple distributed microphone arrays, which is a non-real-time track and does not have any constraints so that participants could explore any algorithms to obtain high speech quality. Targeting the real video conferencing room application, the challenge database was recorded from real speakers and all recording facilities were located by following the real setup of conferencing room. In this challenge, we open-sourced the list of open source clean speech and noise datasets, simulation scripts, and a baseline system for participants to develop their own system. The final ranking of the challenge will be decided by the subjective evaluation which is performed using Absolute Category Ratings (ACR) to estimate Mean Opinion Score (MOS), speech MOS (S-MOS), and noise MOS (N-MOS). This paper describes the challenge, tasks, datasets, and subjective evaluation. The baseline system which is a complex ratio mask based neural network and its experimental results are also presented.

연구 동기 및 목표

  • 복잡한 음향 조건을 가진 실제 영상 회의 환경에서 원거리 다채널 음성 강화에 대한 연구를 자극하기 위해.
  • 실제 회의실에서의 리버버버션, 배경 소음, 마이크와 화자 간 거리의 변동성 등 도전 과제를 해결하기 위해.
  • 실제 구현에 적합한 낮은 지연 시간과 미래 프레임 의존성이 없는 실시간 음성 강화 시스템을 촉진하기 위해.
  • 고급 알고리즘적 접근을 통해 다중 분산 마이크 배열을 활용한 비실시간 탐색을 통해 향상된 음성 품질을 달성하기 위해.
  • 주관적 평가를 통한 절대 카테고리 평가(ACR)를 활용하여 평균 의견 점수(MOS), 음성 MOS(S-MOS), 소음 MOS(N-MOS)를 측정하는 벤치마크를 수립하기 위해.

제안 방법

  • 도전 과제는 크기, 재질, 소음 유형이 다른 12개의 서로 다른 회의실에서 기록된 실제 세계 데이터셋을 사용하며, 세 가지 기하학적 구조를 가진 다수의 마이크 배열을 포함한다.
  • 과제 1의 경우, 최대 40ms의 프레임 길이와 인텔 코어 i5 프로세서에서 실시간 인자 ≤1.0을 만족하는 실시간 처리가 강제된다.
  • 과제 2의 경우, 비실시간 처리를 통해 다중 분산 마이크 배열을 활용한 알고리즘 탐색이 가능하다.
  • 기준 시스템은 복소 비율 마스크(CRM) 기반 신경망을 사용하며, 첫 번째 마이크의 진폭과 위상, 네 개의 마이크 쌍에서 얻은 채널 간 위상 차이(IPD)를 입력으로 사용한다.
  • 입력 특징는 주파수 축을 따라 연결되어 6F×T 텐서로 변환되며, 이는 실수 값 LSTM(3층)을 거쳐 전결합층을 통해 CRM의 실수부와 허수부를 예측한다.
  • 예측된 CRM를 사용하여 역 STFT를 통해 음성 재구성한다: Y_r = M_r * X_0r - M_i * X_0i 와 Y_i = M_r * X_0i + M_i * X_0r.

실험 결과

연구 질문

  • RQ1실제 영상 회의 환경에서 복소 비율 마스크 기반 딥러닝 시스템이 원거리 다채널 음성 강화에 얼마나 효과적인가?
  • RQ2낮은 지연 시간을 유지하면서도 높은 청취적 음성 품질을 확보하기 위해 단일 마이크 배열 기반 실시간 처리가 가능한가?
  • RQ3단일 배열 대비 다중 분산 마이크 배열이 음성 강화 성능 향상에 얼마나 기여하는가?
  • RQ4채널 간 위상 차이(IPD)의 사용이 리버버버션 환경에서 다채널 음성 강화의 강건성을 어떻게 향상시키는가?
  • RQ5다양한 SNR(0–30 dB)를 가진 시뮬레이션 데이터로 학습한 모델이 실제 환경 테스트 조건으로의 일반화에 어떤 영향을 미치는가?

주요 결과

  • 기준 시스템은 인텔 Xeon 프로세서에서 실시간 인자 0.0425를 달성하여 실용적 구현에 적합한 뛰어난 실시간 성능를 입증하였다.
  • 개발 시뮬레이션 세트에서 노이즈가 있는 음성을 효과적으로 강화하였으며, 이는 향상된 음성 품질 지표로 입증되었다.
  • 다중 마이크 배열의 경우, 원형, 선형 균일, 선형 비균일 배열의 세 개의 단일 배열 모델 출력을 SNR 기반으로 선택하는 방식이 단일 모델 사용보다 略적으로 더 우수한 성능을 보였다.
  • 네 개의 전략적으로 선택된 마이크 쌍에서의 채널 간 위상 차이(IPD) 사용은 공간 캐릭터리스틱 추정 능력을 향상시켜 더 나은 강화 성능를 가능케 하였다.
  • 도전 과제에는 총 17개 팀에서 21건의 제출이 들어왔으며, 다섯 팀이 두 과제 모두에 참가하여 이 분야에 대한 높은 연구 관심과 적극적인 참여를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.