Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-channel Time-Varying Covariance Matrix Model for Late Reverberation Reduction

Masahito Togami|arXiv (Cornell University)|2019. 10. 19.
Speech and Audio Processing참고 문헌 29인용 수 6
한 줄 요약

이 논문은 후향성 감쇠 감소를 위한 다중채널 시간변동 공분산 행렬 모델을 제안한다. 후향성의 분산을 음성 소스 분산과 시간 불변 다중채널 공분산 행렬의 컨볼루션으로 모델링한다. 이 방법은 시간 변화하는 음향 조건에서의 강인성을 향상시키며, 특히 동적 환경에서 뛰어난 디레버버버레이션 성능을 달성한다. 확장된 입력 모델(PROPOSED 2)은 FWSegSNR 및 PESQ와 같은 핵심 지표에서 모든 기준 모델을 능가한다.

ABSTRACT

In this paper, a multi-channel time-varying covariance matrix model for late reverberation reduction is proposed. Reflecting that variance of the late reverberation is time-varying and it depends on past speech source variance, the proposed model is defined as convolution of a speech source variance with a multi-channel time-invariant covariance matrix of late reverberation. The multi-channel time-invariant covariance matrix can be interpreted as a covariance matrix of a multi-channel acoustic transfer function (ATF). An advantageous point of the covariance matrix model against a deterministic ATF model is that the covariance matrix model is robust against fluctuation of the ATF. We propose two covariance matrix models. The first model is a covariance matrix model of late reverberation in the original microphone input signal. The second one is a covariance matrix model of late reverberation in an extended microphone input signal which includes not only current microphone input signal but also past microphone input signal. The second one considers correlation between the current microphone input signal and the past microphone input signal. Experimental results show that the proposed method effectively reduces reverberation especially in a time-varying ATF scenario and the second model is shown to be more effective than the first model.

연구 동기 및 목표

  • 시간 변화하는 조건에서 다중채널 음성 디레버버버레이션에서 음향 전달 함수(ATF) 추정의 불안정성을 해결한다.
  • 정적 ATF 모델의 한계를 극복하기 위해 ATF 변동에 강건한 확률적 공분산 행렬 모델을 도입한다.
  • 단일채널 비음수 컨볼루션 전달 함수(N-CTF) 모델을 다중채널 프레임워크로 확장하여 공간 다양성을 활용한다.
  • 두 가지 공분산 행렬 모델을 개발한다: (1) 현재 마이크 신호의 후향성 공분산 행렬, (2) 과거 입력을 포함한 확장된 신호를 위한 모델로 현재 신호와의 시간적 상관관계를 포착한다.
  • 기존 방법들이 WPE 및 N-CTF와 같이 성능이 저하되는 시간 변화 ATF 시나리오에서의 디레버버버레이션 성능을 향상시킨다.

제안 방법

  • 후향성 공분산 행렬을 N-CTF를 통한 음성 소스 분산과 음향 전달 함수(ATF)의 시간 불변 다중채널 공분산 행렬의 컨볼루션으로 모델링한다.
  • 두 가지 모델을 정의한다: (1) 현재 마이크 입력에서의 후향성 공분산 행렬, (2) 과거 마이크 신호를 포함하여 현재 신호와의 상관관계를 포착하는 확장 모델.
  • 비용 함수의 단조 감소를 보장하기 위해 보조 함수 기반 최적화 방법을 사용하며, 다중채널 비음수 행렬 분해(MNMF)와 유사하다.
  • 다중채널 공분산 행렬을 ATF의 공간적 표현으로 간주하여 시간 변화 조건에서도 강인한 추정이 가능하도록 한다.
  • 공분산 행렬의 파라미터를 변분 베이지안 유사 방법으로 최적화하여 ATF와 음성 소스의 동시 추정이 필요 없도록 한다.
  • 시간 변화 공분산 모델을 기존 디레버버버레이션 프레임워크에 통합하며, 향후 작업에서 평균 벡터 모델링을 포함할 수 있도록 확장 가능하다.

실험 결과

연구 질문

  • RQ1시간 변화하는 ATF에서 후향성 감쇠를 효과적으로 감소시킬 수 있는 시간 변화 다중채널 공분산 행렬 모델은 동적 음향 환경에서 유용한가?
  • RQ2과거 마이크 신호를 공분산 모델에 통합할 경우, 현재 신호만을 사용하는 경우에 비해 디레버버버레이션 성능은 어떻게 향상되는가?
  • RQ3제안된 공분산 행렬 모델은 정적 ATF 모델이나 단일채널 N-CTF 접근 방식보다 ATF 변동에 더 강인한가?
  • RQ4과거 신호를 포함한 시간적 상관관계를 포착하는 확장된 마이크 입력 신호 모델은 원래 모델 대비 얼마나 디레버버버레이션 성능을 향상시키는가?
  • RQ5제안된 방법은 WPE, N-CTF, KEMD, VB-MSD와 같은 최신 기술보다 시간 불변 및 시간 변화 ATF 시나리오 모두에서 더 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • 제안된 방법은 시간 변화 ATF 시나리오에서 기준 모델을 크게 능가하며, FWSegSNR 12.36 dB, PESQ 1.72를 기록하여 TIV의 10.74 dB 및 1.42에 비해 뛰어난 성능을 보였다.
  • PROPOSED 2(과거 신호를 포함한 확장 모델)는 시간 불변 조건에서 모든 지표에서 최고 성능을 기록했으며, FWSegSNR 12.92 dB, PESQ 1.91을 달성했다.
  • 시간 변화 공분산 행렬 모델(PROPOSED 1 및 2)은 시간 불변 공분산 행렬만을 사용하는 TIV보다 일관되게 뛰어난 성능을 보였으며, 동적 조건에서의 효과성을 입증했다.
  • 시간 변화 ATF의 경우, PROPOSED 2는 다음으로 우수한 방법인 VB-MSD보다 FWSegSNR 1.62 dB 향상 및 PESQ 0.30 향상 달성했다.
  • 확장 모델(PROPOSED 2)은 셀스트럼 거리(CD)를 3.40 dB로 낮춰 모든 방법 중에서 가장 낮은 값을 기록했으며, 이는 뛀난 스펙트럼 엔벨롭 추정 능력을 의미한다.
  • 이 방법은 ATF 변동에 대해 강인함을 입증했으며, WPE 및 N-CTF가 심각하게 성능 저하되는 것과는 달리, ATF가 시간에 따라 변동하더라도 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.