Skip to main content
QUICK REVIEW

[論文レビュー] Improved Deep Speaker Feature Learning for Text-Dependent Speaker Recognition

Lantian Li, Yiye Lin|arXiv (Cornell University)|Jun 28, 2015
Speech Recognition and Synthesis参考文献 5被引用数 6
ひとこと要約

この論文では、音声の変動を低減するための音声依存DNNを導入し、時間的モデリングを改善するための動的時間ワープィング(DTW)とセグメントプーリングを提案することで、文依存型話者認識における深層話者特徴の学習を向上させている。提案手法は、ベースラインのd-vector(10.29%)からEERを8.14%まで低減し、PLDAを組み合わせた場合、一部の状況でi-vectorベースラインを上回る性能を示している。

ABSTRACT

A deep learning approach has been proposed recently to derive speaker identifies (d-vector) by a deep neural network (DNN). This approach has been applied to text-dependent speaker recognition tasks and shows reasonable performance gains when combined with the conventional i-vector approach. Although promising, the existing d-vector implementation still can not compete with the i-vector baseline. This paper presents two improvements for the deep learning approach: a phonedependent DNN structure to normalize phone variation, and a new scoring approach based on dynamic time warping (DTW). Experiments on a text-dependent speaker recognition task demonstrated that the proposed methods can provide considerable performance improvement over the existing d-vector implementation.

研究の動機と目的

  • 既存のd-vectorシステムが文依存型話者認識においてi-vectorベースラインに劣る性能を示すという限界を是正すること。
  • 話者埋め込みへの発音変動の影響を軽減するため、DNNの入力に発音ポスタリオリを組み込むこと。
  • 標準的なd-vectorの平均化では無視される時間的制約を活用することでスコアリングを改善すること。
  • 固定フレーズ音声の時間的ダイナミクスをよりよくモデル化できる判別的スコアリング手法を検討すること。
  • 改善されたd-vectorシステムとi-vectorシステムを組み合わせることで、最先端の性能を達成することを示すこと。

提案手法

  • DNNの入力に発音ポスタリオリを組み込むことで、音声依存学習を可能にし、話者埋め込みへの発音変動の影響を低減する。
  • 平均プーリングの代わりにセグメントプーリングを採用し、発話全体を固定長のセグメントに分割し、各セグメントに対してd-vectorを算出する。
  • 動的時間ワープィング(DTW)を用いてセグメントごとのd-vectorをアラインメントおよびスコアリングし、フレーム間の時間的関係を保持する。
  • 40次元のフィルタバンク特徴量と発音ポスタリオリを入力とし、最後の隠れ層からフレームレベルの特徴量を抽出する多層DNNを採用する。
  • ベースラインシステムではPLDAとLDAを用いて判別的スコアリングを行うが、d-vectorでは固有の判別性があるためこれらを省略する。
  • 最良のd-vectorシステム(DNN+PT+DTW)とi-vectorシステムをスコアレベルの補間により統合し、性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1DNNの入力に発音ポスタリオリを組み込むことで、発音関連のばらつきを低減し、話者埋め込みの品質を向上させることができるか?
  • RQ2単純な平均プーリングと比較して、セグメントプーリングまたはDTWベースのスコアリングが、文依存型話者認識の性能向上に寄与するか?
  • RQ3改善されたd-vectorシステムは、i-vectorベースラインを上回るか、同等の性能を発揮するか?
  • RQ4スコアレベルの統合による、強化されたd-vectorシステムとi-vectorシステムの組み合わせによる性能向上はどの程度か?
  • RQ5提案手法は、固定内容のテストフレーズにおいてEERにどのような影響を与えるか?

主な発見

  • 発音ポスタリオリの組み込み(DNN+PT)により、d-vectorのEERがわずかに改善され、フレーズP1では10.29%から10.24%に低下した。
  • セグメントプーリング(DNN+PT+SEG)により、P1でのEERは9.95%に低下し、全フレーズで一貫した改善が確認された。
  • DTWベースのスコアリング(DNN+PT+DTW)は、単一システムとして最良の性能を示し、P1では9.14%、P5では8.14%のEERを達成した。
  • 最良のd-vectorシステム(DNN+PT+DTW)とi-vectorシステム(PLDA)をスコア補間により統合した結果、P1でのEERは1.52%にまで低下した。
  • 統合システムは個々のシステムを上回り、i-vectorベースライン単体と比較してP2では最大1.2ポイント、P4では0.8ポイントのEER低減が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。