[논문 리뷰] A Two-stage Complex Network using Cycle-consistent Generative Adversarial Networks for Speech Enhancement
이 논문은 단일 채널 음성 증강을 위해 Cycle-GAN과 심층 복소수 노이즈 제거 네트워크를 조합한 이단계 복소수 네트워크를 제안한다. 먼저, 사이클 일致성 조건을 유지하면서 청소된 음성의 크기를 추정하는 Cycle-GAN을 사용하고, 이후 복소수 값의 노이즈 제거 네트워크가 위상과 잔여 노이즈를 정밀하게 보정함으로써 다양한 데이터셋에서 최신 기술 수준(SOTA)의 음성 품질 향상과 노이즈 억제 성능을 달성한다.
Cycle-consistent generative adversarial networks (CycleGAN) have shown their promising performance for speech enhancement (SE), while one intractable shortcoming of these CycleGAN-based SE systems is that the noise components propagate throughout the cycle and cannot be completely eliminated. Additionally, conventional CycleGAN-based SE systems only estimate the spectral magnitude, while the phase is unaltered. Motivated by the multi-stage learning concept, we propose a novel two-stage denoising system that combines a CycleGAN-based magnitude enhancing network and a subsequent complex spectral refining network in this paper. Specifically, in the first stage, a CycleGAN-based model is responsible for only estimating magnitude, which is subsequently coupled with the original noisy phase to obtain a coarsely enhanced complex spectrum. After that, the second stage is applied to further suppress the residual noise components and estimate the clean phase by a complex spectral mapping network, which is a pure complex-valued network composed of complex 2D convolution/deconvolution and complex temporal-frequency attention blocks. Experimental results on two public datasets demonstrate that the proposed approach consistently surpasses previous one-stage CycleGANs and other state-of-the-art SE systems in terms of various evaluation metrics, especially in background noise suppression.
연구 동기 및 목표
- 사이클 일치성 제약 조건으로 인해 잔여 노이즈가 남는 CycleGAN 기반 음성 증강 모델의 한계를 해결하기 위해.
- 낮은 신호 대 노이즈(SNR) 조건에서 위상 왜곡을 극복하기 위해 청소된 위상과 잔여 노이즈를 동시에 추정함으로써.
- 크기와 위상 추정을 이단계 학습 프레임워크로 분리함으로써 음성 품질과 이해 가능성 향상을 도모하기 위해.
- 종단 간 복소수 스펙트럼 매핑을 위한 새로운 복소수 신경망을 도입하며, 시간-주파수 주의 메커니즘을 통합함으로써.
- 공개 데이터셋을 기반으로 이단계 접근 방식이 한 단계 Cycle-GAN 및 기타 최신 기술 수준(SOTA) 방법들보다 뛰어난 성능을 보임을 검증하기 위해.
제안 방법
- 이중 단계 프레임워크를 설계함: 첫 번째 단계에서, 상대적 평균 손실과 사이클 일치성 손실을 사용하여 청소된 스펙트럼 크기를 추정하는 Cycle-GAN 기반 크기 매핑 네트워크(CycleGAN-MM)를 적용한다.
- 추정된 크기를 원본 노이즈가 있는 위상과 조합하여 두 번째 단계의 입력으로 사용하는 근사적인 증강 복소 스펙트럼을 생성한다.
- 두 번째 단계에서 복소수 값의 깊이 있는 노이즈 제거 네트워크(DCD-Net)를 도입하여 청소된 스펙트럼의 실수부와 허수부를 동시에 추정함으로써 복소 스펙트럼을 정밀하게 보정한다.
- DCD-Net은 복소수 2D 합성곱 및 역합성곱 레이어와 함께, 시간 및 주파수 도메인에서 장거리 의존성을 모델링하기 위한 복소수 값의 시간-주파수 주의(T-FA) 블록을 활용한다.
- 전체 시스템은 단계적으로 학습되며, 첫 번째 단계는 사전 학습된 후 두 번째 단계의 미세 조정이 이루어진다.
- 두 번째 단계에서 손실 계산을 위해 복소수 비율 마스크를 사용하여 위상 추정 정확도를 향상시킨다.

실험 결과
연구 질문
- RQ1크기와 위상 추정을 분리함으로써 성능을 향상시킬 수 있는 이단계 학습 프레임워크는 음성 증강 성능 향상에 기여하는가?
- RQ2Cycle-GAN 기반 크기 추정기 이후 복소수 값의 노이즈 제거 네트워크를 통합함으로써 잔여 노이즈와 위상 왜곡을 줄일 수 있는가?
- RQ3양 단계에 모두 통합된 시간-주파수 주의 메커니즘은 전역적 의존성 모델링을 향상시키고 낮은 SNR 조건에서의 성능 향상에 기여하는가?
- RQ4제안된 이단계 복소수 네트워크는 한 단계 Cycle-GAN 및 기타 최신 기술 수준(SOTA) 방법들과 비교해 목적적 및 주관적 평가 지표에서 뛰어난 성능을 보이는가?
- RQ5제안된 방법은 다양한 노이즈 유형과 SNR 수준에서 강인한가?
주요 결과
- 제안된 이단계 모델인 CycleGAN-DCD는 Babble 및 Factory1 노이즈 유형에서 각각 CycleGAN-MM 대비 평균 0.32 및 0.30 PESQ 향상을 달성한다.
- Babble 및 Factory1 노이즈에서 세그먼탈 SNR(SSNR)가 각각 0.99 dB 및 1.03 dB 향상되어 뛰어난 노이즈 억제 성능을 입증한다.
- WSJ0-SI84 + DNS 데이터셋에서, Factory1 및 Babble 노이즈 조건에서 각각 0.27 및 0.30 DNSMOS 점수 향상을 CycleGAN-MM보다 달성한다.
- 가장 우수한 비-GAN 기반 백본인 Noncausal-GCRN 대비 CycleGAN-DCD는 평균적으로 PESQ를 0.06 향상시키고, STOI를 0.33% 향상시키며, SSNR를 0.21 dB 향상시킨다.
- CBAK(잔여 노이즈)와 COVL(전반적인 품질)에서의 뚜렷한 향상은 왜곡 감소와 함께 향상된 음성 품질을 확인한다.
- 제거 분석 결과, 두 번째 단계의 복소수 노이즈 제거 네트워크가 위상 복구 및 잔여 노이즈 억제에 필수적임을 입증하였으며, 이는 한 단계 모델들보다 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.