Skip to main content
QUICK REVIEW

[論文レビュー] T-vectors: Weakly Supervised Speaker Identification Using Hierarchical Transformer Model

Yanpei Shi, Mingjie Chen|arXiv (Cornell University)|Oct 29, 2020
Speech Recognition and Synthesis参考文献 20被引用数 6
ひとこと要約

本論文では、マルチスプーカー音声における弱教師付きスプーカー識別を目的とした、メモリ機構を備えた階層的トランスフォーマー基盤モデル、Tベクトルを提案する。フレームレベルおよびセグメントレベルのエンコーダーでマルチヘッドアテンションを活用し、再帰的メモリ接続を組み合わせることで、ConcatおよびOverlapのシナリオにおいて、SWBC-SデータセットでHベクトルおよびSベクトルに対してそれぞれ13.3%および10.5%の相対的改善を達成した。

ABSTRACT

Identifying multiple speakers without knowing where a speaker's voice is in a recording is a challenging task. This paper proposes a hierarchical network with transformer encoders and memory mechanism to address this problem. The proposed model contains a frame-level encoder and segment-level encoder, both of them make use of the transformer encoder block. The multi-head attention mechanism in the transformer structure could better capture different speaker properties when the input utterance contains multiple speakers. The memory mechanism used in the frame-level encoders can build a recurrent connection that better capture long-term speaker features. The experiments are conducted on artificial datasets based on the Switchboard Cellular part1 (SWBC) and Voxceleb1 datasets. In different data construction scenarios (Concat and Overlap), the proposed model shows better performance comparaing with four strong baselines, reaching 13.3% and 10.5% relative improvement compared with H-vectors and S-vectors. The use of memory mechanism could reach 10.6% and 7.7% relative improvement compared with not using memory mechanism.

研究の動機と目的

  • 正確なセグメントレベルのアノテーションが得られないマルチスプーカー音声録音におけるスプーカー識別の課題に対処すること。
  • Hベクトルのような従来モデルがGRUの使用により学習が遅く、勾配消失を引き起こすという限界を克服すること。
  • フレームレベルエンコーダー間のメモリ機構の導入により、長期的なスプーカー特徴モデリングを向上させること。
  • トランスフォーマーの並列処理およびアテンション機構を活用し、重複する会話におけるスプーカー固有の特徴をよりよく捉えること。
  • 発話レベルのスプーカー・ラベルのみを用いた弱教師付き学習で強力な性能を示し、大規模データセットにおけるスケーラブルなトレーニングを可能にすること。

提案手法

  • フレームレベルエンコーダーとセグメントレベルエンコーダーを備えた階層的アーキテクチャを採用し、両者ともトランスフォーマー・エンコーダー・ブロックに基づく。
  • 系列の順序情報を入力音声特徴に組み込むために正弦波位置エンコーディングを用いる。
  • サイズM、ストライドHのスライディング・ウィンドウを用いて入力系列を重複するセグメントに分割し、N個のフレームレベルエンコーダーで処理する。
  • フレームレベルエンコーダー間のメモリ接続を備えたマルチヘッド自己アテンション機構を実装し、セグメント間で隠れ状態を維持する。
  • 各フレームレベルエンコーダーの後に統計プーリングを適用し、最終的に2層の全結合層とシグモイド活性化関数を備えた分類器を適用する。
  • 発話レベルのスプーカー・ラベル集合を監視情報として用い、バイナリ・クロスエントロピー損失でモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤の階層的アーキテクチャは、HベクトルのようなRNNベースのモデルを弱教師付きスプーカー識別において上回ることができるか?
  • RQ2フレームレベルエンコーダー間のメモリ機構の統合は、長期的スプーカー表現学習にどのように影響を与えるか?
  • RQ3トランスフォーマー・ブロックにおけるマルチヘッドアテンションは、TDNNと比較して、重複スプーカー特徴のモデリングをどの程度改善するか?
  • RQ4スライディング・ウィンドウ分割におけるウィンドウサイズ(M)は、モデル性能にどのように影響するか?
  • RQ5提案されたTベクトルモデルは、異なるデータ構築シナリオ(Concat対Overlap)およびスプーカー数の変動に対して、一般化性能を示すか?

主な発見

  • Concatシナリオにおいて、SWBC-SデータセットでHベクトルに対して13.3%、Sベクトルに対して10.5%の相対的改善を達成した。
  • Overlapシナリオでは、Hベクトルに対して10.56%、Sベクトルに対して7.7%の相対的改善を示した。
  • メモリ機構の導入により、メモリなしの同様のモデルと比較して、特に長発話において10.6%および7.7%の相対的性能向上が得られた。
  • フレームレベルのセグメンテーションにおける最適なウィンドウサイズは25フレームであり、ConcatおよびOverlap両設定で最高の性能を達成した。
  • 発話内のスプーカー数が増加するにつれて性能が低下し、特に3スプーカー条件で重複会話の複雑さの影響により最悪の結果が観察された。
  • 限られた学習データでも強力なロバストネスを示し、大規模な弱教師付き学習へのスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。