Skip to main content
QUICK REVIEW

[論文レビュー] Improvement of Text Dependent Speaker Identification System Using Neuro-Genetic Hybrid Algorithm in Office Environmental Conditions

Md. Rabiul Islam, Md. Fayzur Rahman|ArXiv.org|Sep 12, 2009
Speech and Audio Processing参考文献 39被引用数 14
ひとこと要約

本稿では、オフィスのような騒音環境におけるテキスト依存型話者識別を向上させるため、ニューロ・ゲネティックハイブリッドアルゴリズムを提案する。ウィーナー・フィルタリング、ケプストラム特徴量(MFCC、LPCなど)およびニューロ・ゲネティック最適化フレームワークを組み合わせることで、オフィス環境下で82.33%の識別精度を達成し、現実の音響環境においても高い耐障害性を示した。

ABSTRACT

In this paper, an improved strategy for automated text dependent speaker identification system has been proposed in noisy environment. The identification process incorporates the Neuro- Genetic hybrid algorithm with cepstral based features. To remove the background noise from the source utterance, wiener filter has been used. Different speech pre-processing techniques such as start-end point detection algorithm, pre-emphasis filtering, frame blocking and windowing have been used to process the speech utterances. RCC, MFCC, MFCC, MFCC, LPC and LPCC have been used to extract the features. After feature extraction of the speech, Neuro-Genetic hybrid algorithm has been used in the learning and identification purposes. Features are extracted by using different techniques to optimize the performance of the identification. According to the VALID speech database, the highest speaker identification rate of 100.000 percent for studio environment and 82.33 percent for office environmental conditions have been achieved in the close set text dependent speaker identification system.

研究の動機と目的

  • 背景ノイズが従来のシステムの性能を低下させるオフィスのような騒音環境における話者識別性能の向上を目的とする。
  • 現実的で理想的でない音響条件におけるテキスト依存型話者認識の低識別精度という課題に取り組む。
  • ニューラルネットワークと遺伝的アルゴリズムを統合したハイブリッド学習メカニズムを構築し、最適な特徴分類を実現すること。
  • スタジオおよびオフィス環境下で、VALID音声データベースを用いてシステムの性能を評価すること。
  • MFCC、LPCなど複数のケプストラムベースの技術を用いた特徴抽出および選択の最適化により、識別能の向上を図ること。

提案手法

  • 処理の前段階として、音声発話における背景ノイズ低減のためウィーナー・フィルタリングを適用した。
  • 音声前処理手順として、音声活動検出(開始・終了点検出)、プリエミphasisフィルタリング、フレームブロッキング、およびハミング窓処理を実施した。
  • 多様なケプストラム特徴量(MFCC、LPC、LPCC、RCC)を抽出し、話者表現の強化を図った。
  • ニューロ・ゲネティックハイブリッドアルゴリズムを採用した—遺伝的アルゴリズムを用いてニューラルネットワークの重みと構造をグローバル最適化し、その後に分類のためのニューラルネットワーク学習を実施した。
  • 特徴選択とパrameterチューニングを遺伝的アルゴリズムで最適化することで、収束性と精度の向上を図った。
  • スタジオ環境(制御された環境)およびオフィス環境(ノイズあり)下で、VALID音声データベースを用いたクローズドセット設定でシステムを評価した。

実験結果

リサーチクエスチョン

  • RQ1従来の手法と比較して、ニューロ・ゲネティックハイブリッドアルゴリズムは、騒音のあるオフィス環境下で話者識別精度を顕著に向上させることができるか?
  • RQ2ウィーナー・フィルタリングは、テキスト依存型話者識別システムにおける背景ノイズ低減にどの程度効果的か?
  • RQ3MFCC、LPC、LPCC、RCCのうち、どの特徴量の組み合わせが騒音環境下で最高の識別精度を達成するか?
  • RQ4遺伝的アルゴリズム最適化の統合は、ニューラルネットワークベースの話者識別器の性能をどの程度向上させるか?
  • RQ5本手法を用いた場合、現実のオフィスのような音響環境下で達成可能な識別率はどの程度か?

主な発見

  • 提案手法は、VALIDデータベースを用いた制御されたスタジオ環境下で100%の話者識別精度を達成した。
  • オフィス環境下では、82.33%の識別精度に到達し、現実のノイズ環境下でも耐障害性を示した。
  • ニューロ・ゲネティックハイブリッドアルゴリズムは、遺伝的探索によるニューラルネットワークの重みとアーキテクチャ最適化により、分類性能を顕著に向上させた。
  • ウィーナー・フィルタリングは背景ノイズを効果的に低減し、信号対雑音比を向上させ、特徴抽出の質を改善した。
  • テストしたケプストラム特徴量の中で、MFCC、LPC、LPCC、RCCが共同で、騒音環境下での話者識別能の向上に寄与した。
  • プリエミphasis、窓関数処理、フレームブロッキングなどの前処理手法の組み合わせにより、特徴の安定性とシステムの信頼性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。