Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Noise Adaptive Speech Enhancement by Discriminator-Constrained Optimal Transport

Hsin-Yi Lin, H. Eric Tseng|arXiv (Cornell University)|2021. 11. 11.
Speech and Audio Processing참고 문헌 8인용 수 9
한 줄 요약

이 논문은 음성 강화에서 비지도 도메인 적응을 위한 새로운 변별자 제약 최적 운반 네트워크(DOTN)를 제안한다. 최적 운반 이론과 생성적 적대적 네트워크를 융합하여 레이블이 없는 타겟 데이터가 없는 상황에서 노이즈 있는 음성 분포를 도메인 간에 정렬한다. 이 방법은 VoiceBank-DEMAND 및 TIMIT 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, PESQ 및 STOI 점수에서 기존의 적대적 도메인 적응 방법을 능가한다. 또한 타겟 도메인의 복잡성이 증가함에 따라도 강건성을 보여준다.

ABSTRACT

This paper presents a novel discriminator-constrained optimal transport network (DOTN) that performs unsupervised domain adaptation for speech enhancement (SE), which is an essential regression task in speech processing. The DOTN aims to estimate clean references of noisy speech in a target domain, by exploiting the knowledge available from the source domain. The domain shift between training and testing data has been reported to be an obstacle to learning problems in diverse fields. Although rich literature exists on unsupervised domain adaptation for classification, the methods proposed, especially in regressions, remain scarce and often depend on additional information regarding the input data. The proposed DOTN approach tactically fuses the optimal transport (OT) theory from mathematical analysis with generative adversarial frameworks, to help evaluate continuous labels in the target domain. The experimental results on two SE tasks demonstrate that by extending the classical OT formulation, our proposed DOTN outperforms previous adversarial domain adaptation frameworks in a purely unsupervised manner.

연구 동기 및 목표

  • 학습 및 테스트 시 노이즈 조건이 다를 경우 발생하는 도메인 이동 문제를 해결하기 위해, 실제 응용에서 흔한 문제에 대응한다.
  • 레이블이 없는 타겟 데이터나 도메인 유형 레이블이 필요 없는 순수하게 비지도 도메인 적응 방법을 개발하여 음성 처리의 회귀 과제, 특히 음성 강화에 적용한다.
  • 기존의 도메인 불변 특징 학습에 의존하거나 노이즈 유형 분류와 같은 보조 정보가 필요한 방법의 한계를 극복한다.
  • 테스트 세트에 다수의 노이즈 유형이 포함된 경우와 같이 타겟 도메인의 복잡성이 증가할 때의 방법의 강건성을 평가한다.
  • 최적 운반과 적대적 훈련의 조합이 회귀 설정에서 소스 도메인에서 타겟 도메인으로 지식을 효과적으로 전이시킬 수 있음을 보여준다.

제안 방법

  • 이 방법은 최적 운반(OT) 이론과 생성적 적대적 네트워크(GANs)를 융합하여 음성 강화에서 비지도 도메인 적응을 위한 변별자 제약 최적 운반 네트워크(DOTN)를 도입한다.
  • DOTN은 소스 도메인의 정제된 음성 분포와 타겟 도메인의 노이즈 있는 음성 간에 최소 비용 운반 계획을 계산함으로써 도메인 이동을 최소화한다.
  • 변별자는 소스 도메인의 실제 정제된 음성과 타겟 도메인에서 생성된 정제된 음성 유사 음성을 구분하도록 훈련되어 출력의 높은 청취 품질을 보장한다.
  • 생성자 네트워크는 OT 비용을 최소화하면서도 변별자의 피드백에 의해 정규화됨으로써 노이즈 있는 타겟 음성에서 정제된 음성으로의 매핑을 학습한다.
  • 훈련 과정은 OT 기반 도메인 정렬과 적대적 손실을 동시에 최적화하여, 모델이 타겟 도메인에서 새로운 노이즈 유형으로 일반화할 수 있도록 한다.
  • 이 프레임워크는 타겟 레이블이나 노이즈 유형 레이블이 필요 없이 소스 도메인의 노이즈-정제 쌍과 타겟 도메인의 노이즈 음성만 필요하다.

실험 결과

연구 질문

  • RQ1최적 운반과 적대적 훈련을 효과적으로 조합하여 음성 강화와 같은 회귀 과제에서 비지도 도메인 적응을 가능하게 할 수 있는가?
  • RQ2PESQ 및 STOI 점수 측면에서 제안된 DOTN 방법은 기존의 적대적 도메인 적응 프레임워크와 비교해 어떻게 성능을 내는가?
  • RQ3타겟 도메인이 다수의 노이즈 유형을 포함할 경우 성능 저하 정도는 어떻게 되며, 치명적인 잊음 현상이 발생하는가?
  • RQ4추가 정보나 레이블 없이도 새로운 노이즈 유형을 포함한 타겟 도메인으로 일반화할 수 있는가?
  • RQ5타겟 도메인의 복잡성(예: 노이즈 유형 수)이 도메인 적응 시스템의 성능에 어떤 영향을 미치는가?

주요 결과

  • VoiceBank-DEMAND 데이터셋에서 DOTN은 PESQ 점수 2.083과 STOI 0.757을 기록하여 DAT(1.400 PESQ, 0.569 STOI)와 MDAN(1.903 PESQ, 0.722 STOI)을 능가했다.
  • TIMIT 데이터셋에서 DOTN은 평균 PESQ 1.780과 STOI 0.690을 기록하여 DAT(1.400 PESQ, 0.569 STOI)와 MDAN(1.766 PESQ, 0.670 STOI)을 초월했다.
  • 다수의 노이즈 유형(H+Ca+Cr+B 등)을 테스트한 결과, 단일 노이즈 유형 모델과 유사한 PESQ 및 STOI 점수를 유지하여 치명적인 잊음 현상 최소화를 확인했다.
  • 네 가지 노이즈 유형을 순차적으로 학습할 경우에만 성능 저하가 관찰되었으며, STOI 점수는 중간 정도로 감소하여 타겟 도메인 복잡성 증가에 강건함을 보였다.
  • 모든 SNR 수준과 노이즈 유형에서 일관된 슈퍼리어리티를 보여주어 실제 다양한 노이즈 환경에서의 효과성을 확인했다.
  • 제거 실험을 통해 OT와 변별자 기반 피드백의 통합이 기본 GAN 또는 OT 전용 접근 방식보다 적응 성능을 크게 향상시킨다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.