Skip to main content
QUICK REVIEW

[論文レビュー] Utterance-level Aggregation For Speaker Recognition In The Wild

Weidi Xie, Arsha Nagrani|arXiv (Cornell University)|Feb 26, 2019
Speech Recognition and Synthesis参考文献 24被引用数 17
ひとこと要約

本論文は、薄いResNet(thin-ResNet)をバックボーンとして用い、発話レベルの特徴集約に辞書ベースのNetVLAD/GhostVLAD層を組み合わせた、軽量でエンド・ツー・エンドで微調整可能なスピーカー認識モデルを提案する。VoxCeleb1で3.22%のEERを達成し、最先端の性能を示した。これは、パrameter数を減らしながらも、従来手法を顕著に上回った。本手法は、識別的な時系列プーリングを学習することで、関係のない音声セグメントを効果的にフィルタリングする。

ABSTRACT

The objective of this paper is speaker recognition "in the wild"-where utterances may be of variable length and also contain irrelevant signals. Crucial elements in the design of deep networks for this task are the type of trunk (frame level) network, and the method of temporal aggregation. We propose a powerful speaker recognition deep network, using a "thin-ResNet" trunk architecture, and a dictionary-based NetVLAD or GhostVLAD layer to aggregate features across time, that can be trained end-to-end. We show that our network achieves state of the art performance by a significant margin on the VoxCeleb1 test set for speaker recognition, whilst requiring fewer parameters than previous methods. We also investigate the effect of utterance length on performance, and conclude that for "in the wild" data, a longer length is beneficial.

研究の動機と目的

  • 発話の長さが異なることや、不要な信号が含まれるなど、制約のない、『野生の状況』におけるスピーカー認識の性能を向上させること。
  • すべてのフレームを等しく扱う従来のプーリング手法(例:平均プーリング)が、ノイズや不要なコンテンツをフィルタリングできないという限界を解消すること。
  • 現実世界のノイジーな環境下で、発話の長さがスピーカー認識性能に与える影響を調査すること。
  • エンド・ツー・エンドの学習により、マージンを大きくとったソフトマックス損失(large-margin softmax loss)を用いて、判別性が高く、固定長の埋め込みを生成するコンactで効率的なモデルを設計すること。

提案手法

  • 2次元スペクトログ램のフレームレベル特徴抽出に、完全畳み込み型の「薄いResNet(thin-ResNet)」アーキテクチャを採用する。
  • 学習可能な辞書ベースのNetVLADまたはGhostVLAD層を用いて、フレームレベル特徴の内容に応じた、判別的な時系列集約を実現する。
  • NetVLAD/GhostVLAD層は、フレーム特徴を学習されたクラスターセンタに割り当て、残差を固定サイズの記述子として符号化する。
  • 大規模なVoxCeleb2データセット上で、大マージンソフトマックス(AM-Softmax)または通常のソフトマックス損失を用いて、ネットワーク全体をエンド・ツー・エンドで学習する。
  • 最終的な認証スコアリングにはコサイン類似度またはPLDAを適用し、テスト時におけるアンバージャー(augmentation)は一切行わない。
  • 評価には、著者が公開したクリーニング済みのVoxCeleb1およびVoxCeleb1-Hテストセットを用いる。
Fig. 1 : Network architecture. It consists of two parts: feature extraction , where a shared CNN is used to encode the spectrogram and extract frame-level features, and aggregation , which aggregates all the local descriptors into a single compact representation of arbitrary length.
Fig. 1 : Network architecture. It consists of two parts: feature extraction , where a shared CNN is used to encode the spectrogram and extract frame-level features, and aggregation , which aggregates all the local descriptors into a single compact representation of arbitrary length.

実験結果

リサーチクエスチョン

  • RQ1制約のないノイジーな環境下でも、NetVLAD/GhostVLADのような辞書ベースの集約層が、標準的なプーリング手法を上回る性能を示せるか?
  • RQ2エンド・ツー・エンド学習を用いた軽量なthin-ResNetアーキテクチャは、より深いがパrameter数の多いモデルに比べ、性能と効率性に優れるか?
  • RQ3発話の長さが『野生の状況』でのスピーカー認識精度にどのように影響するか?
  • RQ4冗長なクラスタを削除するGhostVLAD層は、不要な音声セグメントをフィルタリングすることで、さらなる性能向上を実現できるか?
  • RQ5アテンションや統計的プーリング手法による性能向上は、依然として判別的な辞書ベースの集約に劣るか?

主な発見

  • 提案モデルは、AM-SoftmaxとGhostVLADを用いてVoxCeleb1テストセットで3.22%のEERを達成し、前回のSOTA(4.48% EER)を顕著に上回り、パrameter数を26Mから10Mに削減した。
  • より困難なVoxCeleb1-Hテストセットでは、5.17%のEERを達成し、元のResNetベースのモデル(7.33% EER)を顕著に上回った。
  • 発話長と性能には強い正の相関関係がある:2秒ではEERが7.97%、6秒では3.39%に低下し、より長いセグメントがロバストネスを向上させることを示した。
  • 時系列平均プーリング(TAP)は、クラス内変動を低減できないため、10.48%のEERという劣った性能を示し、クラス間分離は向上するが、クラス内変動の低減に失敗していることが示された。
  • GhostVLAD層はクラスタ数(8〜14)に強く依存せず、あらゆる設定でEERが0.1%未満の変動に抑えられ、安定した性能を示した。
  • thin-ResNet、NetVLAD/GhostVLAD、AM-Softmax損失の組み合わせにより、極めて小さなモデルサイズで最先端の性能が達成され、効率性と有効性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。