[논문 리뷰] spatial-dccrn: dccrn equipped with frame-level angle feature and hybrid filtering for multi-channel speech enhancement
이 논문은 다중채널 음성 향상 모델인 Spatial-DCCRN을 제안하며, 프레임 수준의 각도 특징과 마스킹 및 매핑 필터링(MMF) 전략을 통합하여 공간 정보 활용도와 잔여 노이즈 억제 성능을 햖थ한다. S-DCCRN 아키텍처를 다중채널 처리로 확장하고, 명시적인 공간 모델링을 위한 각도 특징 추출(AFE) 모듈을 적용하며, 기존의 필터링-합산 방식을 사다리식으로 연결된 MMF로 대체함으로써, L3DAS22 및 ConferencingSpeech2021 도전 과제에서 최신 기술 수준(SOTA) 성능을 달성하였으며, MIMO-Unet 및 EaBNet과 같은 모델들을 능가하였다.
Recently, multi-channel speech enhancement has drawn much interest due to the use of spatial information to distinguish target speech from interfering signal. To make full use of spatial information and neural network based masking estimation, we propose a multi-channel denoising neural network -- Spatial DCCRN. Firstly, we extend S-DCCRN to multi-channel scenario, aiming at performing cascaded sub-channel and full-channel processing strategy, which can model different channels separately. Moreover, instead of only adopting multi-channel spectrum or concatenating first-channel's magnitude and IPD as the model's inputs, we apply an angle feature extraction module (AFE) to extract frame-level angle feature embeddings, which can help the model to apparently perceive spatial information. Finally, since the phenomenon of residual noise will be more serious when the noise and speech exist in the same time frequency (TF) bin, we particularly design a masking and mapping filtering method to substitute the traditional filter-and-sum operation, with the purpose of cascading coarsely denoising, dereverberation and residual noise suppression. The proposed model, Spatial-DCCRN, has surpassed EaBNet, FasNet as well as several competitive models on the L3DAS22 Challenge dataset. Not only the 3D scenario, Spatial-DCCRN outperforms state-of-the-art (SOTA) model MIMO-UNet by a large margin in multiple evaluation metrics on the multi-channel ConferencingSpeech2021 Challenge dataset. Ablation studies also demonstrate the effectiveness of different contributions.
연구 동기 및 목표
- 기존 다중채널 음성 향상 모델이 공간 정보를 암묵적으로 학습하거나 최적화되지 않은 필터링-합산 연산에 의존하는 한계를 해결하기 위해.
- 특히 잔여 노이즈를 줄이기 위해 음성과 노이즈가 동일한 시간-주파수 영역에 동시에 존재하는 도전적인 조건에서의 성능 향상을 위해.
- 채널 간 위상 차이(IPD)에서 유도된 프레임 수준의 각도 특징을 통해 공간 정보를 명시적으로 모델링하기 위해.
- 거친 노이즈 제거, 음향 반사 제거, 잔여 노이즈 억제를 사다리식으로 통합하는 새로운 필터링 전략을 개발하기 위해.
- L3DAS22 및 ConferencingSpeech2021을 포함한 벤치마크 데이터셋에서 최신 기술 수준의 모델들과 비교해 뛰어난 성능을 보여주기 위해.
제안 방법
- S-DCCRN에서 유도된 계단식 하위채널 및 전체채널 처리 전략을 다중채널 환경으로 확장하여 국소적 및 전반적 채널 정보를 별도로 모델링할 수 있도록 하였다.
- 코시파(Phase Difference, cosIPD) 특징을 컨볼루션 레이어와 밀집 블록을 사용해 처리하는 각도 특징 추출(AFE) 모듈을 도입하여 프레임 수준의 공간 임베딩을 생성하였다.
- 기존의 표준 필터링-합산 연산을 새로운 마스킹 및 매핑 필터링(MMF) 메커니즘으로 대체하였으며, 마스킹은 반사 제거 및 거친 노이즈 제거를 담당하고, 매핑은 잔여 노이즈 제거를 수행하였다.
- 스택된 노이즈가 있는 스펙트럼과 매핑 필터로부터 3D 컨볼루션 블록을 사용해 마스킹 필터를 추정함으로써 스펙트럼 및 위상 성분의 공동 최적화를 가능하게 하였다.
- 청각적 품질과 강인성을 향상시키기 위해 STOI, WER(Wav2Vec2.0 기반), 그리고 PHASEN 손실을 조합한 하이브리드 손실 함수를 사용하였다.
- 기본 모델에 인과적 추론을 적용하고 최적 성능 확보를 위해 비인과적 변형도 평가하였으며, 아블레이션 연구를 통해 각 구성 요소의 기여도를 검증하였다.

실험 결과
연구 질문
- RQ1채널 간 위상 차이에서 유도된 명시적 프레임 수준의 각도 특징이 다중채널 음성 향상 성능을 향상시키는가?
- RQ2사다리식 마스킹-매핑 필터링 전략이 잔여 노이즈 억제와 반사 제거 측면에서 기존의 필터링-합산 방식을 능가하는가?
- RQ3하위채널 및 전체채널 처리의 통합이 다중채널 딥 네트워크에서 공간 및 스펙트럼 모델링을 어떻게 향상시키는가?
- RQ4각도 특징과 MMF 모듈이 실제 다중채널 음성 향상 벤치마크에서 성능 향상에 얼마나 기여하는가?
- RQ5명시적 공간 특징 학습과 다단계 필터링을 결합한 모델이 L3DAS22 및 ConferencingSpeech2021 도전 과제에서 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- Spatial-DCCRN은 L3DAS22 도전 과제 데이터셋에서 0.956의 지표 점수를 기록하여 MIMO-Unet 및 EaBNet을 포함한 최신 기술 수준 모델들을 능가하였다.
- ConferencingSpeech2021 도전 과제 개발 세트에서 Spatial-DCCRN은 모든 지표에서 MIMO-Unet을 앞서며, 기준 모델 대비 통합 지표에서 0.057 향상되었고, 기본 모델 대비 AFE와 MMF를 모두 사용한 경우 0.016 향상되었다.
- AFE 모듈은 지표 점수에 0.011 기여하였고, MMF 모듈은 0.007 기여하였으며, 이는 공간 특징 학습이 필터링 설계보다 더 큰 영향을 미친다는 것을 시사한다.
- 비인과적 버전의 Spatial-DCCRN이 최고의 성능을 기록하여, 이 작업에서 비인과적 모델링의 이점이 확인되었다.
- PHASEN과 SI-SNR 손실을 함께 사용할 경우 개별적으로 사용할 경우보다 더 좋은 결과를 얻었으며, 이는 시간 및 주파수 도메인에서의 공동 최적화가 강인성을 향상시킨다는 것을 보여준다.
- 입력 채널 수가 4개에서 8개로 증가함에 따라 성능이 크게 향상되어, 다마이크로폰 환경에서의 확장성과 강인성을 입증하였다.
![Fig. 2 : Network structure of angle feature extraction and sub/full channel DCCRN. ‘GCC‘ denotes group complex convolution, ‘GCTC‘ denotes group complex transpose convolution and ‘CP‘ denotes convolution pathway – a convolution layer among the encoder and decoder [ 17 ] . ”AF” denotes angle feature](https://ar5iv.labs.arxiv.org/html/2210.08802/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.