Skip to main content
QUICK REVIEW

[論文レビュー] Speaker Identification by GMM based i Vector

Soumen Kanrar|arXiv (Cornell University)|Apr 12, 2017
Speech Recognition and Synthesis参考文献 9被引用数 3
ひとこと要約

本稿では、次元削減とコサイン距離スコアリングを用いて予測精度を向上させるGMMベースのi-vectorフレームワークを提案する。ガウス・ミックスチャネル・モデルを用いて発話者特性をモデル化し、チャネル変動に対処するためi-vector適応を適用することで、多様な録音条件や言語環境下でもより信頼性の高い発話者識別が可能となり、マルチチャネル・マルチリンガルデータを用いたシミュレーションにおいて、正規化スコアベースラインを上回る性能を発揮する。

ABSTRACT

Speaker Identification process is to identify a particular vocal cord from a set of existing speakers. In the speaker identification processes, unknown speaker voice sample targets each of the existing speakers present in the system and gives a predication. The predication may be more than one existing known speaker voice and is very close to the unknown speaker voice. The model is a Gaussian mixture model built by the extracted acoustic feature vectors from voice. The i-vector based dimension compression mapping function of the channel depended speaker, and super vector give better predicted scores according to cosine distance scoring associated with the order pair of speakers. In the order pair, the first coordinate is the unknown speaker i.e. test speaker, and the second coordinates is the existing known speaker i.e. target speaker. This paper presents the enhancement of the prediction based on i- vector in compare to the normalized set of predicted score. In the simulation, known speaker voices are collected through different channels and in different languages. In the testing, the GMM voice models, and GMM based i-Vector speaker voice models of the known speakers are used among the numbers of clusters in the test data set.

研究の動機と目的

  • チャネル変動および多様な録音条件が存在する状況下での発話者識別精度の向上を目的とする。
  • i-vector適応が次元削減を図りながらも発話者特徴を保持する有効性を検証することを目的とする。
  • i-vectorスーパーベクトルにおけるコサイン距離スコアリングの性能を発話者識別に応用して評価することを目的とする。
  • GMMベースのi-vectorシステムが複数の言語および録音チャネルにわたってどの程度頑健であるかを評価することを目的とする。
  • 予測信頼性の観点から、提案手法を正規化スコアベースラインと比較することを目的とする。

提案手法

  • 本システムは、既知の発話者音声サンプルから抽出された音声特徴ベクトルを用いてトレーニングされたガウス・ミックスチャネル・モデル(GMM)を用いる。
  • i-vectorはGMMから導出され、高次元の発話者表現を低次元空間に圧縮することで、チャネル依存のばらつきを低減する。
  • i-vectorマッピング関数にチャネル補償技術を適用し、チャネル効果に対する耐性を高める。
  • 発話者確認は、テスト発話者のi-vector(第1座標)と既知発話者のi-vector(第2座標)との間のコサイン距離スコアリングにより実行する。
  • 各発話者のモデルを効率的な比較が可能なように、i-vectorから構築されたスーパーベクトルを用いる。
  • 一般化および耐性を評価するために、マルチチャネルおよびマルチリンガルのテストセットを用いてフレームワークを評価する。

実験結果

リサーチクエスチョン

  • RQ1i-vectorに基づく次元削減は、チャネル変動下での発話者識別性能をどの程度向上させるか?
  • RQ2i-vectorスーパーベクトルにおけるコサイン距離スコアリングは、正規化スコアベースラインと比較して予測精度をどの程度向上させるか?
  • RQ3GMMベースのi-vectorシステムは、異なる録音チャネルおよび言語に対してどの程度頑健であるか?
  • RQ4提案手法は、多様な音響環境下で複数の既知発話者の中から未知発話者を信頼性高く同定できるか?
  • RQ5i-vector適応は、発話者モデルのコンパクト性および識別力にどのような影響を与えるか?

主な発見

  • GMMベースのi-vector手法は、正規化スコアベースラインと比較して顕著に発話者識別精度を向上させる。
  • 本システムは、テストデータセットにおける複数の録音チャネルおよび多様な言語で頑健な性能を示す。
  • i-vectorの次元削減は、チャネル依存のばらつきを効果的に低減し、モデルの一般化能力を向上させる。
  • i-vectorスーパーベクトルにおけるコサイン距離スコアリングは、他のスコアリング手法と比較してより信頼性が高く識別力に優れた予測をもたらす。
  • 本手法は、マルチスケーラー発話者識別タスクにおいて、より高い予測信頼性と低い誤り率を達成する。
  • シミュレーション結果から、i-vector適応が類似発話者音声を区別する能力を高めることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。