Skip to main content
QUICK REVIEW

[論文レビュー] Performance Evaluation of Statistical Approaches for Text Independent Speaker Recognition Using Source Feature

R. Rajeswara Rao, V. Kamakshi Prasad|arXiv (Cornell University)|Apr 25, 2011
Speech Recognition and Synthesis参考文献 14被引用数 5
ひとこと要約

この論文は、線形予測(LP)残差をソース特徴量として用い、発話内容に依存しない話者認識のための統計的手法—混合ガウスモデル(GMMs)および隠れマルコフモデル(HMMs)—を評価している。結果として、連続的で非再帰的なHMMがGMMを上回り、TIMITデータベースにおいて話者認識でほぼ100%の正確性を達成した。これは、HMMが話者特定の励起成分をモデル化するのに有効であることを示している。

ABSTRACT

This paper introduces the performance evaluation of statistical approaches for TextIndependent speaker recognition system using source feature. Linear prediction LP residual is used as a representation of excitation information in speech. The speaker-specific information in the excitation of voiced speech is captured using statistical approaches such as Gaussian Mixture Models GMMs and Hidden Markov Models HMMs. The decrease in the error during training and recognizing speakers during testing phase close to 100 percent accuracy demonstrates that the excitation component of speech contains speaker-specific information and is indeed being effectively captured by continuous Ergodic HMM than GMM. The performance of the speaker recognition system is evaluated on GMM and 2 state ergodic HMM with different mixture components and test speech duration. We demonstrate the speaker recognition studies on TIMIT database for both GMM and Ergodic HMM.

研究の動機と目的

  • 発話内容に依存しない話者認識において、特にLP残差を用いたソース特徴量が話者固有の情報をどのように効果的に捉えられるかを調査すること。
  • 話者識別に向けた励起成分のモデル化において、GMMとHMMの性能を比較すること。
  • 混合成分数とテスト音声の長さを変化させた場合の認識正確性への影響を評価すること。
  • 連続的で非再帰的なHMMがGMMに比べて、話者固有の励起パターンを効果的に捉えられることを示すこと。

提案手法

  • 発話の励起成分は、源関連の情報を捉える線形予測(LP)残差を用いてモデル化される。
  • LP残差から話者固有の特徴量が抽出され、音声信号内の源励起を表現する。
  • 混合ガウスモデル(GMMs)は、LP残差特徴量上で訓練され、話者分布をモデル化する。
  • 2状態の連続的で非再帰的なHMMを用いて、励起信号の時間的ダイナミクスをモデル化し、スペクトル的および時間的特徴を両方捉える。
  • 両モデルの性能は、混合成分数とテスト期間を変化させながらTIMITデータベース上で評価される。
  • 認識正確性は、各話者に対するモデルテンプレートとのテスト発話の尤度スコアを比較することで測定される。

実験結果

リサーチクエスチョン

  • RQ1線形予測残差は、発話内容に依存しない話者認識において、話者固有の励起情報を効果的に表現できるか?
  • RQ2GMMとHMMは、話者認識に向けた励起成分のモデル化において、どのように比較されるか?
  • RQ3混合成分数とテスト発話の長さを変化させた場合、認識正確性にどのような影響を与えるか?
  • RQ4連続的で非再帰的なHMMは、励起信号からの話者固有の特徴をGMMよりも効果的に捉えられるか?

主な発見

  • 連続的で非再帰的なHMMは、ほぼ100%の認識正確性を達成し、話者認識タスクにおいてGMMを顕著に上回った。
  • LP残差から得られる励起成分には、話者固有の情報が豊富に含まれており、統計モデルによって効果的に捉えられた。
  • HMMベースのシステムはGMMに比べて優れた性能を示し、特に励起信号の時間的ダイナミクスのモデル化において顕著であった。
  • テスト発話の長さが延びるにつれて認識正確性が向上した。これは、信頼できる話者モデル化に十分な音声長さが重要であることを示している。
  • 異なる混合成分設定においても、HMMがGMMを上回る性能向上が一貫して得られた。これはHMMアプローチの堅牢性を示している。
  • 結果から、適切な統計フレームワークでモデル化されたソース特徴量は、発話内容に依存しない話者認識において非常に有効であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。