Skip to main content
QUICK REVIEW

[논문 리뷰] AV Speech Enhancement Challenge using a Real Noisy Corpus

Mandar Gogate, Ahsan Adeel|arXiv (Cornell University)|2019. 09. 30.
Speech and Audio Processing참고 문헌 10인용 수 7
한 줄 요약

이 논문은 카페와 레스토랑과 같은 소음이 많은 환경에서 기록된 실생활의 음성-시각 음성 향상 데이터셋인 ASPIRE 코퍼스를 소개한다. 청각 및 시각적 신호를 융합하는 딥 뉴럴 네트워크(CochleaNet)를 사용하여, 실생활의 소음 환경에서 AV 음성 향상 기법이 오직 청각 기반 방법보다 유의미하게 뛰어난 성능을 보임을 입증하였다. 특히 AV CochleaNet는 MUSHRA 테스트에서 가장 높은 주관적 품질 점수를 기록하였다.

ABSTRACT

This paper presents, a first of its kind, audio-visual (AV) speech enhacement challenge in real-noisy settings. A detailed description of the AV challenge, a novel real noisy AV corpus (ASPIRE), benchmark speech enhancement task, and baseline performance results are outlined. The latter are based on training a deep neural architecture on a synthetic mixture of Grid corpus and ChiME3 noises (consisting of bus, pedestrian, cafe, and street noises) and testing on the ASPIRE corpus. Subjective evaluations of five different speech enhancement algorithms (including SEAGN, spectrum subtraction (SS) , log-minimum mean-square error (LMMSE), audio-only CochleaNet, and AV CochleaNet) are presented as baseline results. The aim of the multi-modal challenge is to provide a timely opportunity for comprehensive evaluation of novel AV speech enhancement algorithms, using our new benchmark, real-noisy AV corpus and specified performance metrics. This will promote AV speech processing research globally, stimulate new ground-breaking multi-modal approaches, and attract interest from companies, academics and researchers working in AV speech technologies and applications. We encourage participants (through a challenge website sign-up) from both the speech and hearing research communities, to benefit from their complementary approaches to AV speech in noise processing.

연구 동기 및 목표

  • 다양한 모odal 음성 향상 시스템을 평가하기 위한 실생활에서 자연스럽게 기록된 음성-시각 음성 코퍼스의 부족을 해결하기 위해.
  • 실제 소음, 화자 이동, 시각적 가림 등의 조건을 반영하여 실생활의 Lombard 효과 조건을 구현한 벤치마크 데이터셋을 제공하기 위해.
  • 실생활 소음 환경에서 주관적 청취 테스트를 통해 음성-시각 음성 향상 알고리즘의 성능을 평가하기 위해.
  • 표준화된 평가 지표를 제공하는 공개 챌린지를 통해 다중모달 음성 처리 분야의 혁신을 촉진하기 위해.
  • 공동 벤치마크를 통해 음성 처리 및 청각 연구 공동체 간의 협력을 장려하기 위해.

제안 방법

  • ASPIRE 코퍼스는 실생활 소음 환경(카페, 레스토랑)과 청각적으로 분리된 부스에서 이어진 마이크로폰과 iPad를 사용해 30 fps로 영상 기록하였다.
  • 각 화자는 실생활 소음 조건과 고립 조건에서 각각 1000개의 발화를 생성하여 총 10,000개의 발화를 포함하며, 다양한 영어 발음이 포함되어 있다.
  • 청각 및 영상 간의 동기화를 위해 클랩 기반 드리프트 보정을 사용하였으며, utterance를 분할하기 위해 Gentle을 사용한 강제 정렬을 실시하였다.
  • 영상 후처리 단계에서 화자 외 영역에 대해 세그멘테이션 마스크를 활용해 픽셀화를 적용하여 개인정보 보호를 실시하였다.
  • CochleaNet라는 딥 뉴럴 네트워크를 학습시켰으며, 이는 Grid 코퍼스의 합성 혼합 신호와 ChiME3의 소음(버스, 카페, 거리, 보행자)을 SNR -12에서 9 dB까지 3 dB 간격으로 다양한 조건에서 학습하였다.
  • AV CochleaNet 모델은 청각 및 시각적 특징을 융합하여 시간-주파수 빈 막대 별로 스펙트럼 마스크를 추정하며, SNR와 무관하게 작동한다.

실험 결과

연구 질문

  • RQ1실생활 소음 환경에서의 실질적인 음성-시각 음성 향상 기법은 오직 청각 기반 방법보다 어떻게 성능이 뛰어나게 되는가?
  • RQ2합성 데이터로 학습된 딥 러닝 모델이 실생활 소음 환경에 효과적으로 일반화되는가?
  • RQ3반사 및 다중 소스 소음 환경에서 시각적 신호가 음성 품질 향상에 얼마나 기여하는가?
  • RQ4실생활 소음 환경에서의 음성-시각 데이터로 테스트한 경우, 다양한 음성 향상 알고리즘이 주관적 품질에서 어떻게 순위가 매겨지는가?
  • RQ5다중모달 접근 방식이 전통적인 오직 청각 기반 방법보다 Lombard 효과와 화자 이동을 더 잘 다룰 수 있는가?

주요 결과

  • AV CochleaNet는 평가된 모든 방법 중에서 가장 높은 MUSHRA 점수를 기록하여 실생활 소음 데이터에서 뛰어난 성능을 입증하였다.
  • 주관적 청취 테스트 결과, AV CochleaNet는 오직 청각 기반 CochleaNet, SEGAN, 스펙트럼 감소(SS), LMMSE보다 유의미하게 뛰어난 성능을 보였다.
  • 모델는 실생활 소음 환경으로의 일반화가 잘 이루어져 반사 및 다중 소스 배경 소음을 효과적으로 억제하였다.
  • 시각 정보의 통합은 특히 화자 이동과 가림이 동반된 고소음 환경에서 음성 품질 향상에 측정 가능한 기여를 하였다.
  • ASPIRE 코퍼스는 AV 음성 향상 시스템의 신뢰할 수 있는 벤치마크를 가능하게 하였으며, 다중모달 접근 방식이 실생활에서의 강건성을 확보하기 위해 필수적임을 입증하였다.
  • 공개 데이터와 표준화된 평가 지표를 포함한 챌린지 프레임워크는 기관 간 재현 가능하고 비교 가능한 연구를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.