Skip to main content
QUICK REVIEW

[論文レビュー] On the use of DNN Autoencoder for Robust Speaker Recognition

Ondřej Novotný, Oldřich Plchot|arXiv (Cornell University)|Nov 7, 2018
Speech and Audio Processing参考文献 11被引用数 10
ひとこと要約

本稿では、ノイズと混浊がかかる音声を綺麗な音声に変換するように学習するDNNオートエンコーダーを、耐障害性の高い音声独立型話者認識の前処理フロントエンドとして提案する。この手法は、特に厳しいノイズと混浊環境下でも顕著な性能向上を示し、ベースライン比で70%以上の相対的改善を達成する。特に、実際の部屋インパulse応答(RIR)を用いたオートエンコーダー強化と、複数条件PLDA学習を組み合わせた結果が最も優れた性能を示した。

ABSTRACT

In this paper, we present an analysis of a DNN-based autoencoder for speech enhancement, dereverberation and denoising. The target application is a robust speaker recognition system. We started with augmenting the Fisher database with artificially noised and reverberated data and we trained the autoencoder to map noisy and reverberated speech to its clean version. We use the autoencoder as a preprocessing step for a state-of-the-art text-independent speaker recognition system. We compare results achieved with pure autoencoder enhancement, multi-condition PLDA training and their simultaneous use. We present a detailed analysis with various conditions of NIST SRE 2010, PRISM and artificially corrupted NIST SRE 2010 telephone condition. We conclude that the proposed preprocessing significantly outperforms the baseline and that this technique can be used to build a robust speaker recognition system for reverberated and noisy data.

研究の動機と目的

  • 実際の電話回線や劣化音声環境における、ノイズと混浊環境下での話者認識の耐障害性を向上させること。
  • DNNベースのオートエンコーダーが話者認識システムの信号前処理フロントエンドとして有効であるかを検証すること。
  • オートエンコーダーに基づく音声強化と複数条件PLDA学習の利点を比較・統合し、システムの耐障害性を向上させること。
  • 訓練データの品質と種別(特に実際のRIRと人工RIR、ノイズ種別)がシステム性能に与える影響を評価すること。
  • オートエンコーダー強化と複数条件PLDA学習を組み合わせた場合、単独で使用する場合よりも優れた性能を発揮するかを特定すること。

提案手法

  • 3層の隠れ層(各1500ニューロン)を持つ深層ニューラルネットワークオートエンコーダーを、ノイズと混浊がかかる入力を綺麗な音声に再構築するように学習した。
  • クリーン音声データとしてFisher英語コーパスを用い、実際のノイズと合成ノイズ、および実際の部屋インパulse応答(RIR)を人工的に付加して、訓練ペアを生成した。
  • 音声とノイズにAウェイトを適用し、人間の聴覚感知を模倣し、VADで検出された音声フレームに基づいてSNRを制御した。
  • オートエンコーダー学習では、31フレームの文脈(3999次元入力)を考慮したログマグニチュードスペクトログラム上で、平均二乗誤差(MSE)を損失関数とした。
  • オートエンコーダーの強化出力を、iベクトルとPLDAに基づく最先端の音声独立型話者認識システムの入力とした。
  • オートエンコーダー前処理と、オートエンコーダー学習で使用したのと同じノイズおよびRIRタイプで汚染されたデータを用いた複数条件PLDA学習を組み合わせた。

実験結果

リサーチクエスチョン

  • RQ1DNNオートエンコーダーに基づく音声強化は、ノイズと混浊環境下での話者認識性能を向上させるか?
  • RQ2実際のRIRと人工的に生成されたRIRの選択が、オートエンコーダーの話者認識性能に与える影響は何か?
  • RQ3オートエンコーダー強化と複数条件PLDA学習は、異なるテスト環境下で、それぞれの耐障害性と性能にどのように差が出るか?
  • RQ4オートエンコーダー前処理と複数条件PLDA学習を組み合わせることで、単独で使用する場合よりも優れた性能が得られるか?
  • RQ5訓練データの量と品質が、オートエンコーダーおよび全体の話者認識システムの有効性に与える影響は何か?

主な発見

  • 実RIRとノイズで学習したN + RRオートエンコーダーが、他のすべてのオートエンコーダー変種を上回り、特に現実世界の混浊とノイズ環境下で顕著な優位性を示した。
  • N + RRオートエンコーダーと複数条件PLDA学習を組み合わせた結果、最も困難なrev-noise-tel-tel条件下で、ベースライン比70%以上の相対的改善が達成された。
  • 最も厳しい条件下では、複数条件PLDA学習が純粋なオートエンコーダー強化をわずかに上回ったが、クリーンデータではオートエンコーダーの劣化が顕著に見られた。
  • 両技術の組み合わせにより、人工RIRと実RIRで学習したシステム間の性能格差が解消され、あらゆる条件下で一貫した耐障害性が達成された。
  • オートエンコーダー学習に実RIRを用いることで、人工RIRを多数用いるよりも優れた結果が得られた。これは、この文脈においてデータの品質が量を上回ることを示している。
  • N + RRオートエンコーダーとN + RRデータ上で複数条件PLDA学習を組み合わせた構成が、すべてのテストセットにおいて最も耐障害性が高く、普遍的に効果的な設定であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。