Skip to main content
QUICK REVIEW

[論文レビュー] Augmentation adversarial training for self-supervised speaker recognition

Jaesung Huh, Hee Soo Heo|arXiv (Cornell University)|Jul 23, 2020
Speech Recognition and Synthesis被引用数 12
ひとこと要約

本論文では、データ拡張(チャネル変動を模擬)に対して不変であるようにモデルを訓練しつつ、話者IDを判別可能に保つことで、話者認識を向上させる自己教師あり手法である拡張対抗訓練(AAT)を提案する。この手法は最先端の性能を達成し、VoxCeleb1でEERを8.65%まで低下させ、従来の自己教師あり手法および人間レベルの性能を上回った。

ABSTRACT

The goal of this work is to train robust speaker recognition models without speaker labels. Recent works on unsupervised speaker representations are based on contrastive learning in which they encourage within-utterance embeddings to be similar and across-utterance embeddings to be dissimilar. However, since the within-utterance segments share the same acoustic characteristics, it is difficult to separate the speaker information from the channel information. To this end, we propose augmentation adversarial training strategy that trains the network to be discriminative for the speaker information, while invariant to the augmentation applied. Since the augmentation simulates the acoustic characteristics, training the network to be invariant to augmentation also encourages the network to be invariant to the channel information in general. Extensive experiments on the VoxCeleb and VOiCES datasets show significant improvements over previous works using self-supervision, and the performance of our self-supervised models far exceed that of humans.

研究の動機と目的

  • 教師なしで音声環境の変化に頑健に一般化する話者認識手法の開発。
  • 自己教師あり学習におけるチャネル変動の課題に対処し、データ拡張が話者埋め込みに環境的特徴を誤って埋め込むのを防ぐ。
  • ノイズや部屋のインパulse応答(RIR)などの不自然な変動に対して不変性を強化しつつ、話者判別能を向上させる。
  • 特にドメインシフトやノイズ環境下において、VoxCeleb1 や VOiCES の標準ベンチマークで既存の自己教師ありモデルを上回ること。

提案手法

  • 同じ発話から得られる重複のない2つのセグメントを正例ペアとしてサンプリングする対照学習フレームワークを採用する。
  • 音声に追加ノイズやRIRを適用することで、多様なチャネル状態を模擬するデータ拡張を両方のセグメントに適用する。
  • 適用された拡張の種別を予測する拡張分類器を導入し、勾配反転層を用いて話者エンコーダーを、この分類器の精度を最小化するように対抗的に訓練する。
  • 話者埋め込み抽出器は、拡張に対して不変であるように訓練され、結果としてチャネル効果に対しても不変になる。
  • 対照損失(例:角的プロトタイプ損失)と、拡張固有の特徴を学習することを罰する対抗損失を組み合わせた訓練目的を採用する。
  • AAT損失重み $\lambda$ を調整し、話者判別能と拡張不変性のバランスを最適化する。

実験結果

リサーチクエスチョン

  • RQ1データ拡張を用いた対抗訓練は、自己教師あり学習における話者認識の頑健性を向上させ得るか?
  • RQ2データ拡張に対する不変性を学習することは、ノイズやリバーブなどの実世界のチャネル変動に対しても不変性を向上させるか?
  • RQ3提案手法は、話者ラベルを一切使用せずにVoxCeleb1およびVOiCESで最先端の性能を達成できるか?
  • RQ4AAT損失重み $\lambda$ は、話者判別能と拡張不変性のトレードオフにどのように影響するか?
  • RQ5AATで訓練されたモデルは、VOiCESデータセットのような未観測ドメインに対してもより良い一般化性能を示すか?

主な発見

  • AATと角的プロトタイプ損失を併用したモデルは、VoxCeleb1でEERが8.65%に低下し、すべての先行自己教師あり手法を顕著に上回った。
  • VOiCESデータセットでは、$\lambda=10$ の条件下でEERが4.96%に達し、未観測ドメインへの強い一般化性能を示した。
  • 最適なAAT損失重みは、VoxCeleb1では $\lambda=3$、VOiCESでは $\lambda=10$ であり、ドメイン依存のハイパーパramータ感受性を示した。
  • AATは、ノイズやRIRを含むすべての拡張設定において、EERと最小検出コスト(MinDCF)を一貫して低減した。
  • EERとMinDCFの指標から、自己教師ありモデルの性能は人間の話者検証性能を上回った。
  • アブレーションスタディにより、AATはきついデータ拡張を用いても性能向上を示し、頑健性強化の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。