Skip to main content
QUICK REVIEW

[논문 리뷰] Relative Transfer Function Estimation Exploiting Spatially Separated Microphones in a Diffuse Noise Field

Nico Gößling, Simon Doclo|arXiv (Cornell University)|2018. 05. 25.
Speech and Audio Processing참고 문헌 9인용 수 8
한 줄 요약

이 논문은 다중 마이크 음성 강화를 위해 산란된 잡음 환경에서 공간적으로 분리된 외부 마이크를 활용하여 상대적 전달 함수(RTF)를 계산적으로 효율적으로 추정하는 방법을 제안한다. 국소 어레이의 잡음 성분과 외부 마이크 간의 공간적 상관성이 무시할 만큼 낮다는 가정 하에, 단지 국소 마이크 공분산 행렬을 사용하여 편향이 없는 RTF 추정기법을 유도한다. 이는 온라인 MVDR beamformer에 통합되었을 때 기존 최고 수준의 방법들보다 추정 정확도와 잡음 제거 성능에서 뛰어나다.

ABSTRACT

Many multi-microphone speech enhancement algorithms require the relative transfer function (RTF) vector of the desired speech source, relating the acoustic transfer functions of all array microphones to a reference microphone. In this paper, we propose a computationally efficient method to estimate the RTF vector in a diffuse noise field, which requires an additional microphone that is spatially separated from the microphone array, such that the spatial coherence between the noise components in the microphone array signals and the additional microphone signal is low. Assuming this spatial coherence to be zero, we show that an unbiased estimate of the RTF vector can be obtained. Based on real-world recordings experimental results show that the proposed RTF estimator outperforms state-of-the-art estimators using only the microphone array signals in terms of estimation accuracy and noise reduction performance.

연구 동기 및 목표

  • 이명도 및 잡음 환경에서 이명도 및 다중 마이크 음성 강화 시스템을 위한 정확한 RTF 추정 문제를 해결하기 위해.
  • 고유값 분해와 같은 반복적 행렬 연산(예: EVD 또는 SVD)을 피하여 RTF 추정의 계산 복잡도를 감소시키기 위해.
  • 국소 어레이 잡음과 낮은 공간적 상관성을 가지는 외부 마이크를 활용하여 추정 정확도와 잡음 제거 성능을 향상시키기 위해.
  • 강건한 RTF 추적 기능을 갖춘 실시간, 온라인 MVDR beamformer의 구현을 가능하게 하기 위해.
  • 머리에 장착된 마이크 및 테이블에 고정된 마이크에서 촬영한 실제 데이터를 사용하여 방법을 검증하기 위해.

제안 방법

  • 외부 마이크의 잡음과 국소 마이크 어레이의 잡음 성분 간의 낮은 공간적 상관성을 활용하기 위해 공간적으로 분리된 외부 마이크를 사용한다.
  • 외부 마이크 신호와 국소 어레이 신호 간의 공간적 상관성을 0으로 가정함으로써 단순화된 RTF 추정기법을 가능하게 한다.
  • 잡음 공분산 추정이 필요 없도록 국소 마이크 어레이의 신호 공분산 행렬에만 기반하여 편향이 없는 RTF 추정치를 도출한다.
  • 실시간으로 변화하는 소스 위치에 적응하기 위해 지수 평균을 사용한 재귀적 공분산 추정을 구현한다.
  • 추정된 RTF를 시간에 따라 변하는 잡음 공분산 추정치를 사용하여 이명도 MVDR beamformer에 적용하여 잡음 제거를 수행한다.
  • RTF 정확도 및 beamformer 성능 평가에 Hermitian 각도와 SNR 향상도를 사용한다.

실험 결과

연구 질문

  • RQ1EVD나 SVD와 같은 반복적 행렬 연산을 피할 수 있는 계산적으로 효율적인 RTF 추정기법을 설계할 수 있는가?
  • RQ2국소 잡음과 낮은 공간적 상관성을 가지는 외부 마이크를 활용하면, 어레이 전용 방법 대비 RTF 추정 정확도가 향상되는가?
  • RQ3제안된 방법이 온라인 MVDR beamformer 환경에서 더 나은 잡음 제거 성능을 달성할 수 있는가?
  • RQ4실제 비정상적인 조건에서 다양한 SNR 및 시간 상수 조건에서 추정기의 성능은 어떠한가?
  • RQ5화자 위치 변화 및 환경 동적 변화에 대해 추정기는 강건한가?

주요 결과

  • 모든 테스트된 SNR 및 시간 상수에서 제안된 SC 기반 RTF 추정기법이 CS 기반 및 CW 기반 추정기법보다 RTF 추정 정확도에서 뛰어나다.
  • 입력 SNR가 0 dB이고 시간 상수가 50 ms일 때, 제안된 추정기법은 첫 22프레임의 음성 활동 이후 R1 및 PM-CS 추정기법보다 낮은 Hermitian 각도 오차를 기록한다.
  • 소음 전용 기간 추정이 필요 없기 때문에, 신호 공분산에만 의존함으로써 제안된 추정기법은 음성 시작에 더 빠르게 적응한다.
  • MVDR 빔포밍에서 제안된 방법은 모든 입력 SNR 및 시간 상수에서 가장 높은 SNR 향상도를 달성하여 뛰어난 잡음 제거 성능을 입증한다.
  • 짧은 시간 상수(50 ms)에서도 높은 정확도를 유지하여 역동적인 화자 이동에 빠르게 적응할 수 있다.
  • 외부 마이크와 국소 어레이 잡음 간의 공간적 상관성이 0이라는 가정 하에 제안된 방법은 편향 없는 RTF 추정이 가능하며, 실제 데이터를 통한 검증을 통해 이를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.