Skip to main content
QUICK REVIEW

[論文レビュー] A Multi Level Data Fusion Approach for Speaker Identification on Telephone Speech

Imen Trabelsi, Dorra Ben Ayed Mezghanni|arXiv (Cornell University)|Jun 27, 2014
Speech and Audio Processing参考文献 17被引用数 5
ひとこと要約

本論文では、MFCC および RASTA-PLP という補完的特徴量を GMM でモデル化し、SVM および Naïve Bayes 分類器を用いて統合する、多段階のデータ統合手法を提案している。この手法は、雑音の強い電話音声環境における文書独立型話者識別において、複数の特徴量と学習モデルを統合することで、性能を顕著に向上させ、NTIMIT データベースにおける耐障害性を示している。

ABSTRACT

Several speaker identification systems are giving good performance with clean speech but are affected by the degradations introduced by noisy audio conditions. To deal with this problem, we investigate the use of complementary information at different levels for computing a combined match score for the unknown speaker. In this work, we observe the effect of two supervised machine learning approaches including support vectors machines (SVM) and naïve bayes (NB). We define two feature vector sets based on mel frequency cepstral coefficients (MFCC) and relative spectral perceptual linear predictive coefficients (RASTA-PLP). Each feature is modeled using the Gaussian Mixture Model (GMM). Several ways of combining these information sources give significant improvements in a text-independent speaker identification task using a very large telephone degraded NTIMIT database.

研究の動機と目的

  • 実際の電話音声環境における雑音の影響による話者識別性能の低下を是正すること。
  • MFCC および RASTA-PLP といった複数の特徴量を組み合わせることで、より高い耐障害性を達成できるかを検討すること。
  • 特徴レベル、スコアレベル、分類器レベルの複数の統合戦略が、システムの正確性に与える影響を評価すること。
  • SVM や Naïve Bayes といった教師あり学習モデルが、補完的特徴量からの証拠を統合する役割を果たすかを調査すること。
  • 大規模で雑音の強い電話音声データベース(NTIMIT)を用いて、文書独立型話者識別において顕著な性能向上を示すこと。

提案手法

  • 著者らは、メル周波数ケプストラム係数(MFCC)と相対スペクトル周波数感知線形予測(RASTA-PLP)係数という2つの異なる特徴量を抽出する。
  • 各特徴量セットは、独立してガウス・ミックスチャネル(GMM)でモデル化され、話者固有の尤度スコアが生成される。
  • 2つの特徴量セットからのマッチングスコアは、複数のレベルで統合される:特徴レベル統合、スコアレベル統合、分類器レベル統合(SVM および Naïve Bayes を用いて)。
  • 異なる特徴表現からの補完的情報を統合することで、劣化した条件下でも識別能を向上させる。
  • システムは、実際の電話音声環境を模倣する大規模で雑音の強い NTIMIT データベースを用いて訓練および評価される。
  • 標準的な話者識別指標を用いて性能を評価し、音声の劣化に対する耐障害性に特に注目する。

実験結果

リサーチクエスチョン

  • RQ1MFCC と RASTA-PLP 特徴量を統合することで、雑音の強い電話音声環境における話者識別性能はどのように向上するか?
  • RQ2スコアおよび分類器レベルでの統合において、SVM と Naïve Bayes 分類器が果たす相対的な貢献度は何か?
  • RQ3特徴レベル、スコアレベル、分類器レベルの多段階統合は、単一レベルまたは単一特徴量アプローチをどれほど上回るか?
  • RQ4異なる統合戦略は、雑音の強い実際の電話環境下でのシステムの耐障害性にどのように影響を与えるか?
  • RQ5補完的特徴表現は、話者識別システムにおける音声劣化によって引き起こされる性能低下を緩和できるか?

主な発見

  • MFCC と RASTA-PLP 特徴量の統合は、単独で使用する場合と比較して、話者識別正確性を顕著に向上させる。
  • GMM を用いたモデリングと、スコアおよび分類器レベルでの SVM および Naïve Bayes 分類器の組み合わせにより、NTIMIT データベース上で顕著な性能向上が達成された。
  • 多段階統合戦略、特にスコアレベル統合が最高の性能を示し、複数の処理段階での証拠統合の有効性を裏付けた。
  • 提案手法は劣化に強く、雑音の強い電話音声環境下でも高い正確性を維持する。
  • 異なる特徴セットからの補完的情報が、文書独立型話者識別タスクにおけるシステムの信頼性と識別能を向上させることを確認した。
  • 教師あり学習モデル(SVM および Naïve Bayes)が、複数の情報源を統合して話者認識性能を向上させる有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。