Skip to main content
QUICK REVIEW

[論文レビュー] CN-CELEB: a challenging Chinese speaker recognition dataset

Yue Fan, Jiawen Kang|arXiv (Cornell University)|Oct 31, 2019
Speech Recognition and Synthesis参考文献 22被引用数 13
ひとこと要約

本稿では、11の多様なジャンルにまたがる1,000人の有名人から130,000件以上の発話が収録された大規模かつ実世界に近い中国語話者認識データセット、CN-Celebを紹介する。実験の結果、最先端のi-vectorおよびx-vectorシステムが、VoxCelebとは対照的にCN-Celebでは著しく性能が低下(EERが最大19.05%まで上昇)することが示された。これは、現実世界の条件が従来想定されていたよりもはるかに大きな課題をもたらすことを示している。

ABSTRACT

Recently, researchers set an ambitious goal of conducting speaker recognition in unconstrained conditions where the variations on ambient, channel and emotion could be arbitrary. However, most publicly available datasets are collected under constrained environments, i.e., with little noise and limited channel variation. These datasets tend to deliver over optimistic performance and do not meet the request of research on speaker recognition in unconstrained conditions. In this paper, we present CN-Celeb, a large-scale speaker recognition dataset collected `in the wild'. This dataset contains more than 130,000 utterances from 1,000 Chinese celebrities, and covers 11 different genres in real world. Experiments conducted with two state-of-the-art speaker recognition approaches (i-vector and x-vector) show that the performance on CN-Celeb is far inferior to the one obtained on VoxCeleb, a widely used speaker recognition dataset. This result demonstrates that in real-life conditions, the performance of existing techniques might be much worse than it was thought. Our database is free for researchers and can be downloaded from http://project.cslt.org.

研究の動機と目的

  • 非制約的環境における話者認識のための現実的で多様かつ大規模なデータセットの不足に応えること。
  • 中国語話者に特化したベンチマークデータセットを提供し、ジャンル、チャネル、環境的条件の変動をカバーすること。
  • 現在の話者認識システム、特に最先端のシステムですら、制約付きデータセットとは対照的に、現実世界の条件下では著しく性能が低下することを示すこと。
  • VoxCelebとは対照的に、言語的およびジャンル的多様性に重点を置いた、より頑健なモデル評価を可能にする補完的データセットを提供すること。

提案手法

  • コンピュータビジョン技術(顔検出、トラッキング、動画・音声同期)を用いて、VoxCelebの自動データ収集パイプラインを再実装した。
  • 1,000人の中国有名人から、インタビュー、歌、ドラマ、ブログ動画など11の実世界のジャンルの音声データを収集した。
  • 自動的プリセレクションと人間による検証の2段階にわたるデータキュレーション戦略を採用し、特に複雑なジャンルにおけるデータ品質を向上させた。
  • 標準的なフロントエンド(GMM-UBMおよびDNN)とバックエンド(LDA-PLDA)パイプラインを用いて、i-vectorおよびx-vectorシステムを訓練し、評価を行った。
  • 公平な比較のため、SITWおよび再セグメンテーション版を含む、EER(等誤差率)を主な指標として使用した。
  • 一般化性能とデータセットの難易度を評価するために、CN-Celeb単体、VoxCeleb単体、および混合データでモデルを訓練するアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1CN-Celebにおける話者認識性能は、広く使われているベンチマークデータセットVoxCelebと比べてどの程度異なるか?
  • RQ2ジャンルの多様性と実世界の録音条件は、最先端の話者認識システムの性能にどの程度悪影響を及えるか?
  • RQ3VoxCelebで学習したモデルは、CN-Celebのような新しい言語的・音響的多様性を持つデータセットに十分に一般化できるか?
  • RQ4同じ挑戦的なテストセットで評価した場合、CN-Celeb単体で学習したモデルはVoxCeleb単体で学習したモデルよりも一般化性能が優れているか?
  • RQ5主に自動化されたパイプラインに人間によるデータ検証を組み込むことで、話者認識システムの頑健性はどのように変化するか?

主な発見

  • i-vectorシステムはCN-Celeb(E)で19.05%のEERを達成したのに対し、SITW(S)では7.30%であった。これは、現実世界の条件下で顕著な性能低下を示している。
  • x-vectorシステムはCN-Celeb(E)で15.52%のEERを示したが、SITW(S)では4.78%にとどまり、このデータセットの難易度の高さが裏付けられた。
  • VoxCelebのより小さな同等のサブセット(VoxCeleb(L))でバックエンドモデルを再訓練した場合、SITW(S)で11.34%のEERを達成し、CN-Celeb(T)単体で学習したシステム(14.24%のEER)を上回った。
  • CN-Celebデータのみで学習したCN-Celeb(T)システムは、CN-Celeb(E)で14.24%のEERを達成したが、これは同じソースからの学習にもかかわらず、一般化性能が著しく低いことを示している。
  • CN-CelebとVoxCelebの性能差は、現在の話者認識モデルが、従来の予想よりも現実世界の非制約的環境においてはるかに脆弱であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。