Skip to main content
QUICK REVIEW

[論文レビュー] Speaker Embedding Extraction with Phonetic Information

Yi Liu, Liang He|arXiv (Cornell University)|Apr 13, 2018
Speech Recognition and Synthesis参考文献 21被引用数 8
ひとこと要約

本稿では、フレームおよびセグメントレベルにおけるマルチタスク学習と共同最適化を用いて、x-vectorスピーカー埋め込み抽出に発音情報を取り込む手法を提案する。FisherデータセットではEERが20%低減され、minDCF08とminDCF10が15%改善され、NIST SRE10でもドメイン外のASRデータを用いても一貫した性能向上を達成する。

ABSTRACT

Speaker embeddings achieve promising results on many speaker verification tasks. Phonetic information, as an important component of speech, is rarely considered in the extraction of speaker embeddings. In this paper, we introduce phonetic information to the speaker embedding extraction based on the x-vector architecture. Two methods using phonetic vectors and multi-task learning are proposed. On the Fisher dataset, our best system outperforms the original x-vector approach by 20% in EER, and by 15%, 15% in minDCF08 and minDCF10, respectively. Experiments conducted on NIST SRE10 further demonstrate the effectiveness of the proposed methods.

研究の動機と目的

  • 従来のスピーカー埋め込み手法が通常はスピーカーIDラベルのみに依存するため、発音情報の活用が不十分であるという問題に対処すること。
  • トレーニング段階で発音コンテンツを補助情報として組み込むことで、スピーカー埋め込みのロバスト性と識別能を向上させること。
  • 二段階の発音ベクトル抽出とフレームレベルのマルチタスク学習に起因する制限を克服し、共同最適化とセグメントレベルの監視を可能にすること。
  • フレームおよびセグメントレベルで動作するマルチタスク学習フレームワークにおける共有隠れ層を活用することで、一般化性能を向上させ、過学習を低減すること。

提案手法

  • スピーカー埋め込みと発音ベクトル抽出を同時に最適化する共同トレーニングフレームワークを提案し、共有DNNアーキテクチャを用いる。
  • フレームレベルとセグメントレベルの両方で分類を実行するマルチタスク学習設定を導入:フレームレベルではスピーカーおよび発音ラベルを予測し、セグメントレベルではスピーカーIDを予測する。
  • スピーカーおよび発音ネットワークの両方で同じ入力特徴を用い、ある深さまで共有隠れ層を経由し、その後にタスク固有の出力ヘッドを設ける。
  • フレームレベルの活性化値に対して統計プーリング(平均および標準偏差)を適用し、スピーカー認識用の固定長セグメントレベル埋め込みを生成する。
  • ドメイン外の発音データ(例:NIST SRE10でSwitchboard-Iを用いる場合)を用いる際は、ASR部のファインチューニングを実施し、発音表現をターゲットドメインに一致させる。
  • LDAおよびPLDAスコア処理後に、標準的なスピーカー認識評価指標(EER、minDCF08、minDCF10)を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1発音情報をx-vectorトレーニングに統合することで、従来のスピーカーIDラベルのみに依存する学習法を上回るスピーカー埋め込み性能が達成可能か?
  • RQ2スピーカーおよび発音ネットワークの共同最適化は、二段階学習に比べてより優れた発音ベクトルと識別性の高いスピーカー埋め込みをもたらすか?
  • RQ3フレームレベルだけでなくセグメントレベルでも動作するマルチタスク学習は、フレームレベルのみのマルチタスク学習と比較して、モデルの一般化性能およびロバスト性にどのように影響を与えるか?
  • RQ4ターゲットデータセット(例:NIST SRE10)とソース(例:Switchboard-I)が異なるドメイン外ASRデータからの発音情報でさえ、スピーカー認識性能の向上に寄与するか?
  • RQ5スピーカー埋め込み抽出における発音監視付きマルチタスク学習の最適な共有層数は何か?

主な発見

  • Fisherデータセットでは、ファインチューニング済み発音ベクトルを用いた本手法は、元のx-vectorと比較してEERを20%低減した。
  • 同様に、minDCF08およびminDCF10もそれぞれ15%改善され、複数の評価指標にわたる一貫した向上が確認された。
  • 共有層を3層にしたマルチタスク学習はFisherで最良の性能を示し、EERは20%、minDCF08は18%低減された。
  • NIST SRE10 core-extendedでは、ファインチューニング済み発音ベクトルを用いた手法がEERを13%、minDCF08を8%低減した。
  • 共有層を3層にしたマルチタスク学習アプローチは、NIST SRE10 core-extendedでEERを29%、minDCF08を18%低減し、不一致するASRデータでも強いロバスト性を示した。
  • NIST SRE10の10s-10s条件では、共有層を2層にしたマルチタスク学習手法が最低のEERを達成した一方、ファインチューニング済み発音ベクトル手法がminDCF08で最高の性能を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。