Skip to main content
QUICK REVIEW

[논문 리뷰] Glance and Gaze: A Collaborative Learning Framework for Single-channel Speech Enhancement

Andong Li, Chengshi Zheng|arXiv (Cornell University)|2021. 06. 22.
Speech and Audio Processing참고 문헌 45인용 수 14
한 줄 요약

이 논문은 단일 채널 음성 증강을 위한 협업 학습 프레임워크인 GaGNet을 제안한다. 이는 복소 도메인에서 위상과 진폭 성분을 함께 최적화함으로써 성능을 햖थ한다. 눈여겨보기 경로(Glance path)를 통해 거친 진폭 추정을 하고, 집중 경로(Gaze path)를 통해 세밀한 스펙트럼 세부 사항을 복구함으로써, 스택된 눈여겨보기-집중 모듈을 통해 반복적으로 음성 스펙트럼을 개선한다. WSJ0-SI84 및 DNS-Challenge 데이터셋에서 최고 성능을 기록하며, 뛰어난 주관적 품질과 낮은 계산 비용을 확보한다.

ABSTRACT

The capability of the human to pay attention to both coarse and fine-grained regions has been applied to computer vision tasks. Motivated by that, we propose a collaborative learning framework in the complex domain for monaural noise suppression. The proposed system consists of two principal modules, namely spectral feature extraction module (FEM) and stacked glance-gaze modules (GGMs). In FEM, the UNet-block is introduced after each convolution layer, enabling the feature recalibration from multiple scales. In each GGM, we decompose the multi-target optimization in the complex spectrum into two sub-tasks. Specifically, the glance path aims to suppress the noise in the magnitude domain to obtain a coarse estimation, and meanwhile, the gaze path attempts to compensate for the lost spectral detail in the complex domain. The two paths work collaboratively and facilitate spectral estimation from complementary perspectives. Besides, by repeatedly unfolding the GGMs, the intermediate result can be iteratively refined across stages and lead to the ultimate estimation of the spectrum. The experiments are conducted on the WSJ0-SI84, DNS-Challenge dataset, and Voicebank+Demand dataset. Results show that the proposed approach achieves state-of-the-art performance over previous advanced systems on the WSJ0-SI84 and DNS-Challenge dataset, and meanwhile, competitive performance is achieved on the Voicebank+Demand corpus.

연구 동기 및 목표

  • 노이즈가 많고 SNR가 낮은 환경에서 위상과 진폭이 상호의존적인 단일 귀 음성 증강 문제를 해결하기 위해.
  • 복소 스펙트럼 도메인에서 진폭과 위상을 함께 최적화하여 음성 품질과 이해도를 향상시키기 위해.
  • 순차적이고 단일 단계 모델의 한계를 극복하기 위해 계층적 개선을 제공하는 병렬 다단계 프레임워크를 도입하기 위해.
  • 디컨볼루션 디코더를 2D 컨볼루션과 잔차 학습으로 대체하여 계산 비용을 줄이고도 높은 성능을 유지하기 위해.
  • DNSMOS를 기준으로 모델 출력을 인간의 주관적 평가와 일치시켜 청각적 품질을 향상시키기 위해.

제안 방법

  • 프레임워크는 각 컨볼루션 레이어 이후에 UNet 스타일의 스킵 연결을 적용하는 스펙트럼 특징 추출 모듈(FEM)로 구성되어 있으며, 다중 척도 특징 재조정을 가능하게 한다.
  • 눈여겨보기-집중 모듈(GGM)은 복소 스펙트럼 최적화를 두 개의 병렬 하위 작업으로 분해한다: 눈여겨보기 경로는 노이즈 제거를 위한 진폭 추정을 수행하고, 집중 경로는 복소 도메인에서 손실된 스펙트럼 세부 사항을 복구한다.
  • 각 GGM은 공유된 인코더-디코더 구조와 잔차 연결을 사용하여 스택된 단계 간에 반복적인 개선을 가능하게 한다.
  • 눈여겨보기 경로는 진폭 도메인에서 거친 스펙트럼 추정을 수행하고, 집중 경로는 복소 도메인에서 위상과 진폭 세부 사항을 정밀하게 개선한다.
  • 모델은 실수-허수 성분을 통한 암묵적 위상 추정을 활용하여 복소 스펙트럼에 대한 MSE 손실을 사용해 엔드 투 엔드로 훈련되며, 명시적인 위상 모델링이 필요 없다.
  • 전치 컨볼루션을 피하기 위해 스트라이드 컨볼루션과 2D 컨볼루션만을 사용하여 MAC 연산과 메모리 사용량을 감소시킨다.

실험 결과

연구 질문

  • RQ1복소 도메인에서 진폭과 위상을 함께 최적화하는 이중 경로 협업 학습 프레임워크는 음성 증강 성능을 향상시킬 수 있는가?
  • RQ2병렬 다단계 아키텍처는 순차적 또는 단일 단계 모델 대비 스펙트럼 정확도와 주관적 품질 측면에서 뛰어나게 작용하는가?
  • RQ3스택된 눈여겨보기-집중 모듈을 통한 반복적 개선은 저SNR 환경에서 더 나은 수렴성과 강건성을 제공하는가?
  • RQ4제안된 방법은 최고 성능 기준 시간 도메인 및 주파수 도메인 기반 모델 대비 계산 효율성과 성능에서 어떻게 비교되는가?
  • RQ5모델은 다양한 SNR 수준과 노이즈 유형을 가진 다양한 데이터셋 간에 얼마나 잘 일반화되는가?

주요 결과

  • WSJ0-SI84 데이터셋에서 GaGNet은 WB-PESQ 2.94를 기록하여 PHASEN 및 MetricGAN+를 포함한 이전 최고 성능 시스템들을 능가한다.
  • DNS-Challenge 데이터셋에서 GaGNet은 모든 네 가지 지표에서 최고 점수를 기록했다: WB-PESQ (2.94), STOI (0.87), SI-SDR (14.8 dB), PESQ (2.71)로 이전 모든 방법들을 능가한다.
  • Voicebank+Demand 데이터셋에서 GaGNet은 CSIG 4.26과 COVL 3.59를 기록하여 고입력 SNR 수준에서도 경쟁력 있는 성능을 보이며 상위 성능 모델 중 하나로 평가된다.
  • 모든 테스트 시스템 중에서 가장 높은 DNSMOS 점수(4.28)를 확보하여 뛰어난 주관적 음성 품질 인식 능력을 보여준다.
  • GaGNet은 유사한 모델 대비 낮은 계산 비용을 가지며, 1초 음성 입력에 대해 뿐만 아니라 1.2M 파라미터와 1.8 GFLOPs로 ConvTasNet보다 지연과 효율성에서 뛰어난 성능을 보인다.
  • 제거 분석 결과 이중 경로 구조와 다단계 스택이 성능 향상에 크게 기여하며, 특히 집중 경로가 잔여 노이즈를 감소시키고 스펙트럼 세부 사항을 복원함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.