Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating generative audio systems and their metrics

Ashvala Vinay, Alexander Lerch|arXiv (Cornell University)|2022. 08. 31.
Music and Audio Processing인용 수 6
한 줄 요약

이 논문은 목적적 지표와 听적 연구를 통해 세 가지 최신 신경 음성 합성 모델—DDSP, NSynth, DiffWave—을 평가하여 기존 목적적 지표가 청각적 품질과 상관이 없다는 것을 밝혀냈다. 강력한 지표 점수에도 불구하고 청취자들은 DDSP와 NSynth보다 DiffWave를 선호했으며, 이는 현재의 지표가 생성 음성 시스템의 실제 음질 평가에 부적합하다는 것을 시사한다.

ABSTRACT

Recent years have seen considerable advances in audio synthesis with deep generative models. However, the state-of-the-art is very difficult to quantify; different studies often use different evaluation methodologies and different metrics when reporting results, making a direct comparison to other systems difficult if not impossible. Furthermore, the perceptual relevance and meaning of the reported metrics in most cases unknown, prohibiting any conclusive insights with respect to practical usability and audio quality. This paper presents a study that investigates state-of-the-art approaches side-by-side with (i) a set of previously proposed objective metrics for audio reconstruction, and with (ii) a listening study. The results indicate that currently used objective metrics are insufficient to describe the perceptual quality of current systems.

연구 동기 및 목표

  • 기존 목적적 지표가 신경 음성 합성에서 청각적 관련성 있는지 평가하기 위해.
  • 일致된 평가 방법을 사용하여 세 개의 주요 생성 음성 모델—DDSP, NSynth, Diffwave—의 음질을 비교하기 위해.
  • 기존 목적적 지표가 생성 음성 시스템에서 청취자 선호도를 신뢰성 있게 예측할 수 있는지 조사하기 위해.
  • 신경 음성 합성 분야의 발전을 저해하는 현재 평가 관행의 한계를 규명하기 위해.

제안 방법

  • NSynth 데이터셋을 사용해 널리 사용되는 세 가지 신경 음성 합성기—DDSP, NSynth, DiffWave—를 훈련하여 비교 평가를 수행하였다.
  • 재구성 오차(예: MSE, MAE), 다양성 측정치(예: NDB/k), 분포 거리 지표(예: IIS, IKID)를 포함한 총 8개의 목적적 지표를 적용하였다.
  • 240명의 참가자가 다양한 악기와 인구 통계적 집단을 기준으로 음성 샘플의 청각적 품질을 평가하는 통제된 청취 연구를 실시하였다.
  • 목적적 지표 점수와 청취자 평가 간 상관 계수(Pearson, Spearman, R²)를 계산하여 지표의 타당성을 평가하였다.
  • 청취자 선호도의 유의미한 차이를 평가하기 위해 통계적 검정(Wilcoxon signed-rank test)을 사용하였다.
  • 악기 종류 및 청취자 인구 통계적 특성에 따라 평가를 분석하여 청각 인식의 체계적 편향을 탐지하였다.

실험 결과

연구 질문

  • RQ1기존의 신경 음성 합성 목적적 지표가 인간 청취자에 의해 평가된 청각적 음질을 신뢰성 있게 예측할 수 있는가?
  • RQ2통제된 청취 연구에서 DDSP, NSynth, DiffWave의 청각적 품질 평가는 어떻게 비교되는가?
  • RQ3생성 음성 시스템에서 목적적 지표 점수와 청취자 평가 간에 유의미한 상관관계가 있는가?
  • RQ4청각적 품질 측면에서 가장 우수한 성능을 보인 모델은 무엇이며, 이는 목적적 지표 순위와 일치하는가?
  • RQ5현재 목적적 지표는 신경 음성 합성 분야의 연구 발전을 이끄는 데 신뢰할 수 있는가?

주요 결과

  • MSE 및 MAE와 같은 목적적 지표와 청취자 평가 간에 통계적으로 유의미한 상관관계가 없었으며, 이는 이러한 지표가 청각적 품질을 신뢰성 있게 반영하지 못한다는 것을 시사한다.
  • 목적적 지표에서 두 번째 순위를 기록했음에도 불구하고, NSynth는 청취 연구에서 DDSP와 DiffWave보다 유의미하게 낮은 평가를 받았으며, 240명 중 163명이 NSynth를 최저로 평가했다.
  • 240명 중 123명이 DiffWave를 DDSP보다 선호했고, 99명이 DDSP를 선호했으며, 이는 DiffWave에 대한 통계적으로 유의미한 선호도(p < 0.05)를 보였다.
  • 목적적 지표 순위(DDSP > DiffWave > NSynth)는 청취자로부터의 청각 순위와 일치하지 않아, 지표와 인간 청각 간의 근본적인 괴리를 드러냈다.
  • IKID 및 IIS 점수는 Diffwave가 DDSP와 NSynth를 능가한다고 시사했으며, 이는 청취 연구 결과와 일치하지만, MSE 및 MAE와 같은 다른 지표들은 청각적 차이를 포착하지 못했다.
  • 결과적으로 현재 목적적 지표는 음질 평가에 부적합하며, 연구는 청각적으로 의미 있는 평가 방법을 우선시해야 한다고 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.