Skip to main content
QUICK REVIEW

[論文レビュー] DeepVOX: Discovering Features from Raw Audio for Speaker Recognition in Degraded Audio Signals.

Anurag Chowdhury, Arun Ross|arXiv (Cornell University)|Aug 26, 2020
Speech and Audio Processing参考文献 52被引用数 5
ひとこと要約

この論文では、音声の劣化に強く、rawな音声音声から直接時域フィルターバンクを学習する1次元畳み込みニューラルネットワークであるDeepVOXを提案する。アダプティブなトリプレットマイニングとエンドツーエンド学習を用いることで、DeepVOXは声源特性と声道特性の両方を捉え、Mel周波数やGammatoneフィルターバンクといった従来の手法を上回り、VOXCeleb2、NIST SRE、Fisherの複数のデータセットおよび複数の劣化タイプにおいて、既存の話者認識システム(xVector-PLDAやiVector-PLDA)を向上させる。

ABSTRACT

Automatic speaker recognition algorithms typically use pre-defined filterbanks, such as Mel-Frequency and Gammatone filterbanks, for characterizing speech audio. The design of these filterbanks is based on domain-knowledge and limited empirical observations. The resultant features, therefore, may not generalize well to different types of audio degradation. In this work, we propose a deep learning-based technique to induce the filterbank design from vast amounts of speech audio. The purpose of such a filterbank is to extract features robust to degradations in the input audio. To this effect, a 1D convolutional neural network is designed to learn a time-domain filterbank called DeepVOX directly from raw speech audio. Secondly, an adaptive triplet mining technique is developed to efficiently mine the data samples best suited to train the filterbank. Thirdly, a detailed ablation study of the DeepVOX filterbanks reveals the presence of both vocal source and vocal tract characteristics in the extracted features. Experimental results on VOXCeleb2, NIST SRE 2008 and 2010, and Fisher speech datasets demonstrate the efficacy of the DeepVOX features across a variety of audio degradations, multi-lingual speech data, and varying-duration speech audio. The DeepVOX features also improve the performance of existing speaker recognition algorithms, such as the xVector-PLDA and the iVector-PLDA.

研究の動機と目的

  • 音声の劣化状況下でも、Mel周波数やGammatoneといった手作業で設計されたフィルターバンクよりも一般化性能が優れたデータ駆動型フィルターバンクを開発すること。
  • ドメイン固有の仮定に依存せずに、rawな音声音声から直接時域フィルターバンクを学習すること。
  • エンドツーエンドの特徴学習により、低品質またはノイズの多い音声環境下での話者認識性能を向上させること。
  • xVector-PLDA や iVector-PLDA といった既存の話者認識システムに、学習されたDeepVOX特徴を統合することで、性能を向上させること。

提案手法

  • Rawな音声音声上でエンドツーエンドに訓練される1次元畳み込みニューラルネットワークが、時域フィルターバンクとしての名前であるDeepVOXを学習する。
  • 特徴の識別性を最大化するため、ハードなトレーニングサンプルを効率的に選択するため、アダプティブなトリプレットマイニングが採用される。
  • コントラスト損失の目的関数を用いて訓練され、同一話者内での特徴の凝縮性と異話者間での分離性を促進する。
  • アブレーションスタディにより、学習されたフィルターバンクが声源特性と声道特性の両方を捉えていることが明らかになった。
  • VOXCeleb2、NIST SRE 2008および2010、Fisherといった複数のデータセットを、さまざまな音声劣化状況下で評価する。
  • 学習されたDeepVOX特徴を標準的な話者認識パイプラインに統合し、性能向上を評価する。

実験結果

リサーチクエスチョン

  • RQ1raw音声から直接学習されるディープラーニングベースのフィルターバンクは、音声劣化下でも従来の手作業で設計されたフィルターバンクを上回る性能を発揮できるか?
  • RQ2学習されたフィルターバンク特徴に、どのような話者特徴(例:声源、声道)がエンコードされているか?
  • RQ3アダプティブなトリプレットマイニング戦略は、学習されたフィルターバンクのロバスト性と一般化性能をどのように向上させるか?
  • RQ4DeepVOX特徴は、xVector-PLDA や iVector-PLDA といった既存の話者認識システムに対して、どの程度性能向上をもたらすか?
  • RQ5多言語データや異なる発話時間の変動がある状況において、この手法はどの程度一般化できるか?

主な発見

  • DeepVOX特徴は、VOXCeleb2、NIST SRE 2008および2010、Fisherデータセットにおいて、さまざまな音声劣化状況下で優れた性能を達成した。
  • アブレーションスタディにより、DeepVOX特徴が声源特性と声道特性の両方をエンコードしていることが確認された。
  • アダプティブなトリプレットマイニング手法は、raw音声から判別性の高い特徴を学習する能力を顕著に向上させた。
  • DeepVOX特徴は、xVector-PLDA および iVector-PLDA システムの性能を向上させ、統合可能性と向上の可能性を示した。
  • 多言語音声データおよび異なる発話時間の変動に対しても、この手法は良好に一般化され、入力のばらつきに対するロバスト性を示した。
  • 劣化下での話者認識精度において、Mel周波数やGammatoneフィルターバンクを上回る性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。