Skip to main content
QUICK REVIEW

[論文レビュー] The Singing Voice Conversion Challenge 2023

Wen-Chin Huang, Lester Phillip Violeta|arXiv (Cornell University)|Jun 26, 2023
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本論文は、NHSSデータセットの選別されたサブセットを用いてドメイン内およびクロスドメインのタスクにおいて、歌唱音声変換(SVC)システムの大型評価である『Singing Voice Conversion Challenge 2023(SVCC)』を提示する。人間並みの自然さを達成したが、いずれのシステムもターゲット話者の類似度に一致せず、客観的指標と主観的スコアの間には弱い相関が見られた。これはSVC性能の評価における課題を浮き彫りにしている。

ABSTRACT

We present the latest iteration of the voice conversion challenge (VCC) series, a bi-annual scientific event aiming to compare and understand different voice conversion (VC) systems based on a common dataset. This year we shifted our focus to singing voice conversion (SVC), thus named the challenge the Singing Voice Conversion Challenge (SVCC). A new database was constructed for two tasks, namely in-domain and cross-domain SVC. The challenge was run for two months, and in total we received 26 submissions, including 2 baselines. Through a large-scale crowd-sourced listening test, we observed that for both tasks, although human-level naturalness was achieved by the top system, no team was able to obtain a similarity score as high as the target speakers. Also, as expected, cross-domain SVC is harder than in-domain SVC, especially in the similarity aspect. We also investigated whether existing objective measurements were able to predict perceptual performance, and found that only few of them could reach a significant correlation.

研究の動機と目的

  • 標準化されたデータセットと共通の評価プロトコルを用いて、最先端の歌唱音声変換(SVC)システムの評価と比較を行う。
  • SVCにおける知覚的性能(自然さと類似度)と客観的評価指標の間のギャップを調査する。
  • 大規模な主観的聴取テストを通じて、ドメイン内SVCと比較してクロスドメインSVCの難易度を評価する。
  • SVCにおいて、話者類似度および自然さの分野で人間の知覚を信頼性高く予測できる客観的指標を同定する。
  • 未解決の課題を特定し、SVCシステムの客観的評価分野における今後の研究を導くことで、分野の前進を図る。

提案手法

  • NHSSデータセットに基づいて新たなデータベースを構築し、2つのタスクをサポートする:任意の話者から1人の話者へのドメイン内SVC、および任意の話者から1人の話者へのクロスドメインSVC。
  • 参加者は提供されたデータセット上でSVCシステムを学習し、評価用に変換された歌唱サンプルを提出した。
  • ネイティブの英語話者および日本語話者を対象とした大規模なクラウドソーシング聴取テストを実施し、自然さと話者類似度を評価した。
  • 客観的指標には、メル倒頻出歪み(MCD)、F0のRMSEおよび相関、2つのASRモデルからの文字誤り率(CER)、シンガー埋め込みのコサイン類似度、およびニューラルMOS予測器(UTMOSおよびSSL-MOS)が含まれる。
  • 客観的指標と主観的スコアの間のスピアマン順位相関係数を計算し、予測性能を評価した。
  • 共通のデータセットと標準化された聴取手順を用いることで、評価フレームワークの一貫性と再現可能性を確保した。

実験結果

リサーチクエスチョン

  • RQ1トップSVCシステムは、ドメイン内およびクロスドメイン設定において、どの程度人間並みの自然さを達成しているか?
  • RQ2既存の客観的指標が、なぜSVCにおける主観的類似度スコアと強く相関しないのか?
  • RQ3自然さと話者類似度の観点から、クロスドメインSVCはドメイン内SVCと比べてどの程度難しいか?
  • RQ4MCD、F0指標、またはASRベースのCERといった現在の客観的指標は、SVCにおける知覚的品質を信頼性高く予測できるか?
  • RQ5ニューラルMOS予測器(例:UTMOS)は、歌唱音声変換における自然さをどの程度正確に予測できるか?

主な発見

  • トップSVCシステムは、ドメイン内およびクロスドメインタスクの両方で人間並みの自然さを達成しており、音声品質における顕著な進歩を示している。
  • どのシステムもターゲット話者の類似度スコアに到達できず、アイデンティティ保持の面で依然として大きなギャップが存在することが示された。
  • クロスドメインSVCはドメイン内SVCよりも顕著に困難であり、平均的な自然さおよび類似度スコアが低かった。
  • 主観的類似度スコアと統計的に有意な相関を示したのは、少数の客観的指標に限られ、特にASRモデルからのCERとシンガー埋め込みのコサイン類似度であった。
  • 類似度予測において最も優れた客観的指標(シンガー埋め込みのコサイン距離)ですら、ネイティブ話者評価においては弱い相関にとどまり、特にクロスドメイン設定では顕著であった。
  • UTMOSのようなニューラルMOS予測器は自然さに対して中程度の相関を示しており、音声から歌唱への一般化は可能であるが、依然として予測力の限界は課題のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。