[논문 리뷰] All Information is Necessary: Integrating Speech Positive and Negative Information by Contrastive Learning for Speech Enhancement
이 논문은 대조 학습을 통해 음성에 유의미한(관련된) 및 음성에 무관한(비관련된) 특징을 통합하는 단일 귀 음성 향상 모델인 CMCR-Net을 제안한다. 대조 및 상호작용 주의를 갖춘 협업 모듈과 대조 정규화 손실을 도입함으로써, 모델은 음성 품질과 이해 가능성 향상을 이끌어내며, 더 낮은 계산 비용으로 최신 기술 수준(SOTA) 성능을 달성한다.
Monaural speech enhancement (SE) is an ill-posed problem due to the irreversible degradation process. Recent methods to achieve SE tasks rely solely on positive information, e.g., ground-truth speech and speech-relevant features. Different from the above, we observe that the negative information, such as original speech mixture and speech-irrelevant features, are valuable to guide the SE model training procedure. In this study, we propose a SE model that integrates both speech positive and negative information for improving SE performance by adopting contrastive learning, in which two innovations have consisted. (1) We design a collaboration module (CM), which contains two parts, contrastive attention for separating relevant and irrelevant features via contrastive learning and interactive attention for establishing the correlation between both speech features in a learnable and self-adaptive manner. (2) We propose a contrastive regularization (CR) built upon contrastive learning to ensure that the estimated speech is pulled closer to the clean speech and pushed far away from the noisy speech in the representation space by integrating self-supervised models. We term the proposed SE network with CM and CR as CMCR-Net. Experimental results demonstrate that our CMCR-Net achieves comparable and superior performance to recent approaches.
연구 동기 및 목표
- 기존 음성 향상 모델이 청소된 음성과 같은 긍정적 정보에만 의존하고 음성과 무관한 특징을 忽시하는 한계를 해결하기 위해.
- 음성과 잡음을 별도로 모델링하는 이중 분지 모델의 높은 파라미터 수와 학습 난이도 문제를 해결하기 위해.
- 음성 관련 및 음성 비관련 특징 간 상관관계를 명시적으로 모델링하여 분류 표현 학습을 향상시키기 위해.
- 추론 복잡도를 증가시키지 않고 일반화 능력을 향상시키는 모델에 종속되지 않는 정규화 기법을 개발하기 위해.
제안 방법
- 자기 주의와 대조 학습을 사용하여 표현 공간에서 음성 관련 및 비관련 특징을 분리하는 협업 모듈(CM)을 설계한다.
- CM 내부에 상호작용 주의를 도입하여 관련 및 비관련 특징 간 상관관계를 자동으로 동적으로 학습하고 융합한다.
- 대조 학습 기반 대조 정규화(CR)를 제안하여 임bedding 공간에서 강화된 음성 표현을 청소된 음성에 가깝게 하고 노이즈가 있는 음성에서 멀리 떨어지도록 한다.
- CM와 CR을 인코더-디코더 아키텍처에 통합하여 CMCR-Net을 구성함으로써 최소한의 추가 파라미터로 엔드 투 엔드 학습을 가능하게 한다.
- 표현 품질 향상과 최신 기술 수준(SOTA) 모델과의 공정한 비교를 위해 UniSpeech-SAT을 사전 훈련된 특징 인코더로 사용한다.
- 재구성 손실과 대조 정규화를 조합하여 모델을 훈련하며, 추론 시에는 CR을 제거하여 계산 오버헤드를 방지한다.

실험 결과
연구 질문
- RQ1긍정적 정보(예: 청소된 음성)에만 의존하는 모델과 비교해 음성과 무관한(부정적) 특징을 통합함으로써 단일 귀 음성 향상 성능이 향상될 수 있는가?
- RQ2분리된 잡음 모델링 없이도 단일 분지 아키텍처가 음성 관련 및 음성 비관련 특징 간 상관관계를 효과적으로 모델링할 수 있는가?
- RQ3임베딩 공간에서 청소된 음성은 가까이, 노이즈가 있는 음성은 멀리 떨어지도록 하는 대조 학습을 음성 향상에서 분류 표현 학습을 향상시키는 데 효과적으로 적용할 수 있는가?
- RQ4제안된 대조 정규화(CR)가 추론 비용을 증가시키지 않고 다양한 잡음 유형과 SNR 조건에서 모델 일반화 능력을 향상시키는가?
- RQ5CMCR-Net 프레임워크가 Voice Bank + DEMAND 및 AVSpeech + AudioSet과 같은 다양한 데이터셋에서 효과적으로 전이되어 기존 최신 기술 수준(SOTA) 모델을 능가할 수 있는가?
주요 결과
- AVSpeech + AudioSet 데이터셋에서 CMCR-Net은 PESQ 3.26과 STOI 90.53%를 기록하여 DCCRN, PHASEN, TFT-Net, SA-TCN, U-Former 등 비교된 모든 최신 기술 수준(SOTA) 방법을 능가한다.
- Voice Bank + DEMAND 데이터셋에서 CMCR-Net은 최고의 PESQ(3.10)와 STOI(93.04%)를 기록했으며, 모델 크기(2.45M 파라미터)와 추론 시간(초당 오디오 0.42초)이 가장 작다.
- DCCRN에 CR을 적용했을 때 STOI는 최대 1.60%p 향상되고 PESQ는 0.06 향상되어, CR의 모델에 종속되지 않는 효과를 입증한다.
- 절단 실험 결과, CR을 제거하면 STOI는 1.78%p 감소하고 PESQ는 0.08 감소하여 CR이 성능 향상에 중요한 기여를 한다는 것을 확인한다.
- 시각화 결과, 기준 모델 대비 CMCR-Net은 잔여 노이즈가 줄어든 더 깔끔한 스펙트로그램을 생성하여 더 나은 노이즈 억제 능력을 보여준다.
- 다양한 잡음 유형(babble, factory, cafeteria)에 대해 일반화 능력이 뛰어나며, 세 가지 잡음 유형을 병합한 복합 조건에서도 성능 저하가 미미하여 STOI와 PESQ는 약간 감소할 뿐 고성능 유지한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.