Skip to main content
QUICK REVIEW

[論文レビュー] Modified Mel Filter Bank to Compute MFCC of Subsampled Speech

Kiran Kumar Bhuvanagiri, Sunil Kumar Kopparapu|arXiv (Cornell University)|Oct 25, 2014
Speech Recognition and Synthesis参考文献 6被引用数 3
ひとこと要約

本稿では、時間圧縮(サブサンプリングされた)音声からMFCCを計算するための修正されたメルフィルタバンクを提案し、元の音声MFCCとの相関を著しく向上させ、認識精度も向上させた。この手法は、元の音声スペクトルと一致するようにフィルタバンクの中心周波数と帯域幅を調整することで、先行手法を上回り、8 kHzにサブサンプリングされた音声の認識精度を16 kHzの元の音声に近づけることを達成した。

ABSTRACT

Mel Frequency Cepstral Coefficients (MFCCs) are the most popularly used speech features in most speech and speaker recognition applications. In this work, we propose a modified Mel filter bank to extract MFCCs from subsampled speech. We also propose a stronger metric which effectively captures the correlation between MFCCs of original speech and MFCC of resampled speech. It is found that the proposed method of filter bank construction performs distinguishably well and gives recognition performance on resampled speech close to recognition accuracies on original speech.

研究の動機と目的

  • 時間圧縮(サブサンプリングされた)音声を処理する際の高い音声認識性能を維持する課題に対処すること。
  • 元の音声からのMFCCとサブサンプリングされた音声からのMFCCとの相関を向上させること。
  • 特に低サンプリングレート下でも認識に不可欠なスペクトル特性を保持するフィルタバンク設計を開発すること。
  • 再トレーニングなしに、元の音声でトレーニングされた既存のHMMモデルをサブサンプリングされた音声のデコードに使用可能にするための基盤を提供すること。

提案手法

  • 元の16 kHz音声のスペクトルエンVELOープと一致するように、特に8 kHzなどのサブサンプリングされた音声に特化した中心周波数および帯域幅を持つ修正されたメルフィルタバンクを設計する。
  • 臨界バンドを低サンプリングレートにマッピングする周波数歪み関数を用い、知覚的マスキング特性を保持する。
  • DFTおよびMFCCの計算の前に、窓関数を適用した後、再サンプリングされた音声フレームに修正されたフィルタバンクを適用する。
  • 標準的手順に従ってMFCCを計算する:ハミング窓処理、DFT、エネルギーの対数計算、逆DFT(ケプストラム変換)。
  • 元の音声とサブサンプリングされた音声のMFCC間の相関を最大化するようにフィルタバンクパラメータを最適化する。
  • AN4データベースを用いて、相関指標(ピアソン係数)およびエンドツーエンドの音声認識を用いて手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1サブサンプリングされた音声を処理する際、メルフィルタバンクをどのように修正すれば、MFCCの相関をより良く保てるか?
  • RQ2HMMモデルが元のサンプリングレートの音声でトレーニングされているが、それをサブサンプリングされた音声に適用する場合、フィルタバンク設計の認識精度に与える影響は何か?
  • RQ3修正されたフィルタバンクは、サブサンプリングされた音声で、元の音声と同等の認識性能を達成できるか?
  • RQ46つの既存のサブサンプリングMFCC計算用フィルタバンク設計と比較して、提案手法は相関および認識精度の面でどのように差をつけるか?

主な発見

  • 提案手法は、元の音声とサブサンプリングされた音声のMFCC間で平均ピアソン相関係数0.986(ケースI)を達成し、最良の先行手法(0.913)を著しく上回った。
  • フレーム単位の相関(ケースII)において、提案手法は平均相関係数0.961を達成したのに対し、最良の先行手法は0.756であった。
  • 提案フィルタバンクを用いた8 kHzサブサンプリング音声の単語認識精度は、ケースAで37.00%、ケースBで77.62%であったのに対し、元の16 kHz音声では43.21%および81.63%であった。
  • 提案手法を用いた認識性能は、最良の先行手法(ケースAで3.88%、ケースBで11.90%)と比較して顕著に優れていた。
  • フィルタバンク出力の可視化分析により、提案手法が元のメルフィルタバンク応答をよく追跡しているのに対し、先行手法は顕著なシフトを示していることが確認された。
  • 性能の向上は、サブサンプリング後でも、元の音声のスペクトル特性と一致するようにフィルタバンクの中心周波数および帯域幅をよりよく整えたことに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。