Skip to main content
QUICK REVIEW

[논문 리뷰] Neural MOS Prediction for Synthesized Speech Using Multi-Task Learning With Spoofing Detection and Spoofing Type Classification

Yeunju Choi, Youngmoon Jung|arXiv (Cornell University)|2020. 07. 16.
Speech Recognition and Synthesis참고 문헌 31인용 수 4
한 줄 요약

이 논문은 합성 음성에 대한 신경망 평균의견 점수(MOS) 예측을 향상시키기 위해 스푸핑 탐지(SD) 및 스푸핑 유형 분류(STC)를 보조 과제로 함께 훈련하는 다중 과제 학습 프레임워크를 제안한다. 스푸핑 탐지 훈련을 균형 잡기 위해 포칼 손실을 사용하여, 기준 모델 대비 MOS 예측 정확도에서 최대 11.6% 상대적 향상을 달성하였으며, 이는 일반화 능력 향상과 평가자 간 변동성에 대한 강건성 향상을 보여준다.

ABSTRACT

Several studies have proposed deep-learning-based models to predict the mean opinion score (MOS) of synthesized speech, showing the possibility of replacing human raters. However, inter- and intra-rater variability in MOSs makes it hard to ensure the high performance of the models. In this paper, we propose a multi-task learning (MTL) method to improve the performance of a MOS prediction model using the following two auxiliary tasks: spoofing detection (SD) and spoofing type classification (STC). Besides, we use the focal loss to maximize the synergy between SD and STC for MOS prediction. Experiments using the MOS evaluation results of the Voice Conversion Challenge 2018 show that proposed MTL with two auxiliary tasks improves MOS prediction. Our proposed model achieves up to 11.6% relative improvement in performance over the baseline model.

연구 동기 및 목표

  • 기존의 신경망 MOS 예측 모델의 성능을 제한하는 주관적 MOS 평가에서의 평가자 간 및 평가자 내 변동성을 해결한다.
  • 관련된 보조 과제인 스푸핑 탐지(SD) 및 스푸핑 유형 분류(STC)를 활용하여 MOS 예측 모델의 일반화 및 강건성을 향상시킨다.
  • 다중 과제 학습에서 SD와 STC 간의 상호보완적 상호작용을 탐색하여 MOS 예측을 위한 특징 학습을 향상시킨다.
  • 스푸핑 탐지에서 어려운 샘플과 쉬운 샘플 간 학습 역학 균형을 유지하기 위해 포칼 손실의 영향을 조사한다. 특히 도메인 이동 상황에서의 영향을 중심으로 분석한다.
  • 인간 평가자가 필요 없이 자동화된 시스템 비교가 가능한 보조 과제의 효과를 입증한다.

제안 방법

  • 257차원의 세기 스펙트로그램을 입력으로 사용하여 발화 수준의 MOS 예측을 수행하는 CNN-BLSTM 기반의 MOSNet을 기준 모델로 채택한다.
  • 두 가지 보조 과제를 도입한다: 이진 스푸핑 탐지(SD)는 음성을 인간 또는 합성 음성으로 분류하고, 스푸핑 유형 분류(STC)는 합성 음성의 소스 시스템을 식별한다.
  • 발화 수준 및 프레임 수준의 MOS 예측을 위한 MSE 손실, SD의 교차 엔트로피 손실, STC의 교차 엔트로피 손실을 조합한 다중 과제 손실 함수를 사용하여 모델을 훈련한다.
  • 스푸핑 탐지 헤드에 포칼 손실을 적용하여 쉬운 음성의 영향을 줄이고, 특히 도메인 이동 상황에서 어려운 예측 샘플에 대한 학습을 향상시킨다.
  • 모든 과제에서 공유되는 인코더 레이어를 사용하여 특징 전이를 가능하게 하며, MOS, SD, STC 예측을 위한 과제별 헤드를 각각 구현한다.
  • t-SNE를 활용해 공유된 특징을 시각화하여, 보조 과제가 특징 공간에 미치는 집중, 무시, 구분 효과를 분석한다.

실험 결과

연구 질문

  • RQ1스푸핑 탐지 및 스푸핑 유형 분류가 합성 음성에 대한 신경망 MOS 예측을 향상시키는 데 효과적인 보조 과제가 될 수 있는가?
  • RQ2스푸핑 탐지에서 포칼 손실을 사용할 경우 MOS 예측 성능에 어떤 영향을 미치는가? 특히 도메인 이동 상황에서의 영향을 중심으로 분석한다.
  • RQ3보조 과제가 다양한 평가자 집단과 스푸핑 유형에 걸쳐 MOS 예측 모델의 일반화 능력을 어느 정도 향상시키는가?
  • RQ4보조 과제가 학습된 공유 특징 표현에 미치는 집중, 무시, 구분 효과는 어떤가?
  • RQ5제안된 다중 과제 학습 프레임워크가 정확도 및 강건성 측면에서 최신 기술 대비 우수한 성능을 보일 수 있는가?

주요 결과

  • 스푸핑 탐지 및 스푸핑 유형 분류를 통한 제안된 다중 과제 학습 모델은 기준 MOSNet 모델 대비 최대 11.6% 상대적 향상된 MOS 예측 성능을 달성한다.
  • 포칼 손실을 적용한 스푸핑 탐지 모델은 특히 도메인 이동이 존재하는 VCC’16 데이터셋에서 일반화 능력이 크게 향상되며, 어려운 예측 샘플에 대한 무시 효과를 완화한다.
  • 스푸핑 유형 분류의 추가로 특징의 구분 능력이 향상되었으며, t-SNE 시각화 결과에서 서로 다른 시스템에서 유래한 프레임들이 더 명확하게 군집화됨을 확인할 수 있었다.
  • t-SNE 플롯에서 스푸핑 탐지의 집중 효과가 관찰되었으며, 인간 음성 및 고품질 합성 음성 프레임이 저품질 프레임과 더 분명히 분리되어 있음을 확인하였다.
  • 스푸핑 탐지에 포칼 손실을 적용한 모델(SD w/ FL)은 VCC’18 및 VCC’16 양쪽에서 표준 SD 모델보다 우수하며, 특히 쉬운 음성의 영향을 줄여 학습에 부정적 영향을 최소화하였다.
  • 제안된 모델는 최신 기술인 MOSNet+EL 모델을 초월하여, 자동화된 음성 품질 평가를 위한 SD 및 STC와의 공동 학습의 효과를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.