Skip to main content
QUICK REVIEW

[논문 리뷰] MetricNet: Towards Improved Modeling For Non-Intrusive Speech Quality Assessment

Meng Yu, Chunlei Zhang|arXiv (Cornell University)|2021. 04. 02.
Speech and Audio Processing참고 문헌 27인용 수 5
한 줄 요약

MetricNet는 지구이동거리(EMD)를 사용한 레이블 분포 학습과 함께 음성 재구성 학습을 통합하여 성능을 향상시키는 새로운 비침습적 음성 품질 평가 모델을 제안한다. PESQ 점수를 소프트 레이블 분포로 모델링하고 음성 재구성을 함께 학습함으로써, 최신 기준 모델 대비 평균제곱오차(MSE)를 28% 감소시키고 진정한 PESQ 점수와의 상관관계를 크게 향상시킨다.

ABSTRACT

The objective speech quality assessment is usually conducted by comparing received speech signal with its clean reference, while human beings are capable of evaluating the speech quality without any reference, such as in the mean opinion score (MOS) tests. Non-intrusive speech quality assessment has attracted much attention recently due to the lack of access to clean reference signals for objective evaluations in real scenarios. In this paper, we propose a novel non-intrusive speech quality measurement model, MetricNet, which leverages label distribution learning and joint speech reconstruction learning to achieve significantly improved performance compared to the existing non-intrusive speech quality measurement models. We demonstrate that the proposed approach yields promisingly high correlation to the intrusive objective evaluation of speech quality on clean, noisy and processed speech data.

연구 동기 및 목표

  • 비차별적이고 수작업으로 만든 특징과 표준 회귀 손실에 의존하는 기존 비침습적 음성 품질 평가 모델의 한계를 해결하기 위해.
  • 더 나은 열화 수준 추정을 위해 음성 신호 재구성 기능을 엔드 투 엔드 학습 프레임워크에 통합하여 모델링 정밀도를 향상시키기 위해.
  • 레이블 분포 학습을 위해 표준 MSE/MAE 손실 대신 지구이동거리(EMD)를 사용하여 학습 안정성과 성능을 향상시키기 위해.
  • 예측 점수 간 상대적 품질 순서를 유지하기 위해 순위 상관관계(SRCC)를 보조 목적함으로써 성능을 향상시키기 위해.
  • 청결한, 노이즈가 있는, 반향이 있는, 처리된 음성 데이터를 포함한 다양한 음성 열화 유형에 대해 우수한 일반화 성능을 달성하기 위해.

제안 방법

  • MetricNet는 1×1 컨벌루션과 딥웨이즈 분리형 컨벌루션을 사용한 잔차 블록(ConvBlocks)을 활용한 딥 네ural 네트워크 아키텍처를 사용하며, PReLU 활성화 함수와 정규화를 적용한다.
  • 모델은 연속적인 PESQ 점수를 N개의 클래스(N=100 또는 500)에 대해 분포로 나누어 레이블 분포 학습을 수행하며, 클래스 간 관계를 모델링하기 위해 가우시안 커널을 사용해 소프트 레이블을 유도한다.
  • 학습 목표는 레이블 분포 학습을 위한 EMD 손실과 별도의 음성 재구성 브랜치를 통해 열악한 입력에서 정제된 음성을 재구성하는 재구성 손실을 조합한다.
  • 예측 점수의 상대적 순서가 진정한 PESQ 순위와 일치하도록 유지하기 위해 순위 상관관계(SRCC) 손실을 도입한다.
  • 모델는 다중 작업 목표를 통해 엔드 투 엔드로 학습되며, 예측된 레이블 분포와 목표 레이블 분포 간의 EMD를 최소화하고, 정제된 음성을 재구성하며, 순서 일致성을 유지하는 것을 목표로 한다.
  • 아키텍처는 청결한, 노이즈가 있는, 반향이 있는, 처리된 음성 등 다양한 종류의 음성 데이터를 포함한 대규모 다각도 데이터셋에서 평가되며, 간섭된 스펙트로그램을 통해 강인성 테스트가 수행된다.

실험 결과

연구 질문

  • RQ1지구이동거리(EMD)를 사용해 PESQ 점수를 소프트 레이블 분포로 모델링하는 것이 표준 회귀 모델 대비 비침습적 음성 품질 평가 성능을 향상시키는가?
  • RQ2음성 재구성 학습을 함께 학습하면 모델의 열화 수준 추정 능력이 향상되는가?
  • RQ3레이어 순위 상관관계(SRCC)를 학습 목적으로 도입하면 모델 성능과 일반화 능력에 어떤 영향을 미치는가?
  • RQ4제안된 학습 기준(EML + 재구성 + SRCC)이 다양한 음성 열화 유형에서 표준 MSE/MAE 기반 방법보다 우수한가?
  • RQ5스펙트로그램 간섭을 통해 도입된 새로운 아티팩트에 대해서도 모델이 일반화 가능한가?

주요 결과

  • MetricNet는 최고의 베이스라인(Quality-Net with frame regularization) 대비 평균제곱오차(MSE)를 28% 감소시켜 간섭된 테스트 데이터에서 MSE 0.060을 기록한다.
  • 테스트 세트에서 선형 상관계수(LCC)는 0.94, 스피어만 순위 상관계수(SRCC)는 0.92를 기록하여 진정한 PESQ 점수와 강한 일치를 보인다.
  • EMD 손실을 사용한 레이블 분포 학습은 최대우도 예측보다 성능이 뛰어나며, 특히 더 세밀한 양자화(N=500)와 소프트 레이블을 사용할 경우 두드러진 성능 향상을 보인다.
  • 음성 재구성 학습이 포함될 경우 성능 향상이 뚜렷하게 나타나며, 재구성 목표 덕분에 더 날카로운 예측 분포를 형성한다.
  • 순위 상관관계 손실은 레이블 분포 학습과 함께 사용할 경우 미세하지만 일관된 성능 향상을 제공하지만, 재구성 학습이 동시에 존재할 경우 추가적인 이득을 제공하지는 않는다.
  • 모델는 간섭된 데이터에서도 뛰어난 성능을 유지하며, 베이스라인의 MSE 0.079에서 MetricNet의 MSE 0.060으로 감소시켜 새로운 아티팩트에 대한 강인성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.