Skip to main content
QUICK REVIEW

[論文レビュー] Improving Performance of Speaker Identification System Using Complementary Information Fusion

Md Sahidullah, Sandipan Chakroborty|arXiv (Cornell University)|May 13, 2011
Speech Recognition and Synthesis参考文献 2被引用数 3
ひとこと要約

本稿では、線形予測解析の残差信号から導出された声帯原動力に基づく特徴(LPCC)と声帯振動に基づく特徴を融合する、新しい話者識別システムを提案する。残差信号の非線形性を高次モーメントでモデル化し、その得られた意思決定スコアをスペクトル特徴と融合することで、2つの公的データベースにおいて単一特徴アプローチを上回る性能を達成した。

ABSTRACT

Feature extraction plays an important role as a front-end processing block in speaker identification (SI) process. Most of the SI systems utilize like Mel-Frequency Cepstral Coefficients (MFCC), Perceptual Linear Prediction (PLP), Linear Predictive Cepstral Coefficients (LPCC), as a feature for representing speech signal. Their derivations are based on short term processing of speech signal and they try to capture the vocal tract information ignoring the contribution from the vocal cord. Vocal cord cues are equally important in SI context, as the information like pitch frequency, phase in the residual signal, etc could convey important speaker specific attributes and are complementary to the information contained in spectral feature sets. In this paper we propose a novel feature set extracted from the residual signal of LP modeling. Higher-order statistical moments are used here to find the nonlinear relationship in residual signal. To get the advantages of complementarity vocal cord based decision score is fused with the vocal tract based score. The experimental results on two public databases show that fused mode system outperforms single spectral features.

研究の動機と目的

  • 従来の話者識別システムがMFCC や LPCC といったスペクトル特徴に依存するが、声帯の寄与を無視するという限界を是正すること。
  • ピッチ周波数や残差信号の位相といった声帯の手がかりが、話者識別性能を向上させる上で補完的役割を果たすかどうかを検討すること。
  • 非線形ダイナミクスを捉えるために、LP 残差信号の高次モーメントに基づく新しい特徴セットを構築すること。
  • 声帯路に基づく特徴と声帯に基づく意思決定スコアのスコアレベルの融合を検討し、システム性能の向上を図ること。
  • 標準化された公的データベースを用いて、提案された統合フレームワークの妥当性を検証すること。

提案手法

  • 線形予測(LP)モデルからの残差信号を抽出し、声帯関連の励起成分を分離すること。
  • LP 残差信号の高次モーメント(例:歪度、尖度)を計算し、非線形関係をモデル化し、話者固有の声帯特性を捉えること。
  • 得られた高次モーメント特徴を、話者識別用の声帯情報の表現として用いること。
  • 比較および統合のため、標準的なスペクトル特徴(例:LPCC)を声帯路に基づく特徴セットとして用いること。
  • 声帯路に基づくシステムと声帯に基づくシステムの意思決定スコアをスコアレベルで統合し、補完的情報を活用すること。
  • 重み付き平均または類似の統合戦略を用いて、2つのスコアストリームを統合し、最終的な話者分類を実行すること。

実験結果

リサーチクエスチョン

  • RQ1LP 残差信号から導出された特徴は、従来のスペクトル特徴では捉えきれない、補足的な話者固有の情報を提供できるか?
  • RQ2高次統計的モーメントは、話者識別において残差信号の非線形ダイナミクスを効果的にモデル化できるか?
  • RQ3声帯路に基づくシステムと声帯に基づくシステムのスコアレベルの統合は、全体の話者識別精度を向上させるか?
  • RQ4ベンチマークデータベースにおいて、統合システムの性能は、個別のスペクトル的または残差に基づくシステムと比べてどうか?
  • RQ5提案された特徴セットは、さまざまな話者識別シナリオおよびデータベースにおいても頑健か?

主な発見

  • LP 残差信号の高次モーメントから導出された声帯に基づく特徴セットは、従来のスペクトル特徴では捉えきれない話者固有の情報を捉えている。
  • 声帯路に基づく(LPCC)と声帯に基づく特徴のスコアレベルの統合により、単独で使用する場合と比較して、話者識別性能が向上した。
  • 2つの公的話者識別データベースにおいて、統合システムは単一特徴システムを上回り、補完的情報統合の有効性を示した。
  • 高次モーメントによる非線形ダイナミクスの取り入れが、話者認識における残差信号の識別力の向上に寄与した。
  • 実験結果から、ピッチや残差信号の特性といった声帯の手がかりが、話者識別において価値ある補完的情報を提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。