Skip to main content
QUICK REVIEW

[論文レビュー] Deep Speaker Embeddings for Far-Field Speaker Recognition on Short Utterances

Aleksei Gusev, Vladimir Volokhov|arXiv (Cornell University)|Feb 14, 2020
Speech Recognition and Synthesis参考文献 33被引用数 5
ひとこと要約

本稿では、騒音が強く、混浊が強い環境下で短い発話における遠方話者認証の性能を向上させるために、MFB特徴量とAM-Softmax学習を用いたResNetベースの深層話者埋め込みシステムを提案する。この手法は、SOTA性能を達成し、VoxCeleb1における1秒発話でEERを2.26%まで低下させ、VOiCESにおける1秒発話で10.80%まで低下させた。x-vectorおよびTDNNベースラインと比較して、短時間発話および騒音環境下で顕著な性能向上を示した。

ABSTRACT

Speaker recognition systems based on deep speaker embeddings have achieved significant performance in controlled conditions according to the results obtained for early NIST SRE (Speaker Recognition Evaluation) datasets. From the practical point of view, taking into account the increased interest in virtual assistants (such as Amazon Alexa, Google Home, AppleSiri, etc.), speaker verification on short utterances in uncontrolled noisy environment conditions is one of the most challenging and highly demanded tasks. This paper presents approaches aimed to achieve two goals: a) improve the quality of far-field speaker verification systems in the presence of environmental noise, reverberation and b) reduce the system qualitydegradation for short utterances. For these purposes, we considered deep neural network architectures based on TDNN (TimeDelay Neural Network) and ResNet (Residual Neural Network) blocks. We experimented with state-of-the-art embedding extractors and their training procedures. Obtained results confirm that ResNet architectures outperform the standard x-vector approach in terms of speaker verification quality for both long-duration and short-duration utterances. We also investigate the impact of speech activity detector, different scoring models, adaptation and score normalization techniques. The experimental results are presented for publicly available data and verification protocols for the VoxCeleb1, VoxCeleb2, and VOiCES datasets.

研究の動機と目的

  • 環境ノイズ、混浊、短い発話期間による話者認証性能の低さという課題に対処すること。
  • 制御不能な音響条件下における短時間発話(1秒、2秒、5秒)の話者埋め込みシステムの耐障害性を向上させること。
  • 短い発話および騒音環境下において、標準的なx-vector(TDNNベース)システムと比較してResNetアーキテクチャの有効性を調査すること。
  • 音声活動検出(VAD)、スコアリングモデル、スコア正規化などのシステム部品を最適化し、性能を向上させること。
  • さまざまなテストプロトコル下で、VoxCeleb1、VoxCeleb2、VOiCESのデータセットにわたる汎化性能を実証すること。

提案手法

  • 高周波数分解能(80バンド)のMFB(メル周波数フィルタバンク)特徴量を用いたResNet34アーキテクチャを採用し、詳細なスペクトルダイナミクスを捉える。
  • 埋め込み抽出器をAM-Softmax(角度マージンソフトマックス)損失関数で学習させ、クラス間マージンを強化し、識別性能を向上させる。
  • エネルギーベースのVADに比べ、ノイズおよび非音声セグメントに対してより頑健な、U-Netベースのエンドツーエンド音声活動検出器(VAD)を導入する。
  • スコアバイアスを低減し、異なるテスト条件下でのスコアのキャリブレーションを向上させるために、ドメイン内センター化およびスコア正規化技術を適用する。
  • 最終的な認証意思決定には、LDA/PLDA適応を施したコサイン類似度(CS)スコアバックエンドを用いる。
  • 標準化されたプロトコルに従い、短い発話(1秒、2秒、5秒)およびフル長発話に対して、VoxCeleb1、VoxCeleb2、VOiCESの複数のデータセットで学習および評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1騒音が強く、混濁が強い遠方話者認証環境下で、短い発話において、ResNetベースの話者埋め込みモデルが、標準的なx-vector(TDNNベース)システムを上回るEER性能を示せるか?
  • RQ2短時間発話(1秒、2秒)で学習させることにより、長時間発話のテストセグメントにおける話者埋め込みモデルの汎化性能にどのような影響を与えるか?
  • RQ3U-NetベースのVADは、エネルギーベースのVADと比較して、騒音が強く遠方の環境下で、どの程度システムの頑健性を向上させるか?
  • RQ4スコア正規化およびドメイン内センター化の貢献度は、VOiCESのような困難なデータセットにおける最終的な認証性能にどの程度影響を与えるか?
  • RQ5異なる損失関数(例:AM-Softmax対標準ソフトマックス)は、短い発話におけるモデルの汎化性能および性能にどのように影響を与えるか?

主な発見

  • ResNet34-MFB80-AM-TrainData-IVモデルは、VoxCeleb1の短い発話プロトコルにおいて1秒発話でEER 2.26%を達成し、ベースラインのResNet34モデル(EER 12.71%)を顕著に上回った。
  • VOiCES(評価セット)において、ResNet34-MFB80-AM-TrainData-IVシステムは1秒発話でEER 10.80%を達成し、同じ条件下でのx-vectorベースライン(EER 25.62%)を上回った。
  • 短い発話(1秒および2秒)で学習させることで、短時間発話テストにおける性能は向上したが、フル長発話ではわずかな劣化が見られた。これは、ドメイン特化最適化のトレードオフを示している。
  • ResNetベースのモデルは、x-vectorシステムと比較して、ノイズおよび混濁に対して優れた頑健性を示し、騒音環境下の短い発話において最大50%のEER改善を達成した。
  • U-NetベースのVADおよびスコア正規化技術は、特に低SNRおよび遠方環境下で追加の性能向上に寄与した。
  • 最高性能を示したシステム、すなわちResNet34-MFB80-AM-TrainData-IVは、すべてのデータセット(VoxCeleb1、VoxCeleb2、VOiCES)で一貫した性能向上を示し、提案されたアーキテクチャおよび学習戦略の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。