Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Corpora Spoken Language Identification with Domain Diversification and Generalization

Spandan Dey, Md Sahidullah|arXiv (Cornell University)|Feb 10, 2023
Speech Recognition and Synthesis参考文献 109被引用数 14
ひとこと要約

本稿では、低リソースなインド語のクロスコーパスspoken language identification (LID)の性能を向上させるために、ドメイン多様化およびドメイン一般化技術を提案する。最大限の多様性に配慮した段階的音声拡張と、拡張タイプを仮ドメインとして扱うことで、ドメイン不変およびドメインに配慮した学習によりECAPA-TDNNモデルを強化し、ベースラインと比較してクロスコーパスEERを最大5.23%まで低減した。

ABSTRACT

This work addresses the cross-corpora generalization issue for the low-resourced spoken language identification (LID) problem. We have conducted the experiments in the context of Indian LID and identified strikingly poor cross-corpora generalization due to corpora-dependent non-lingual biases. Our contribution to this work is twofold. First, we propose domain diversification, which diversifies the limited training data using different audio data augmentation methods. We then propose the concept of maximally diversity-aware cascaded augmentations and optimize the augmentation fold-factor for effective diversification of the training data. Second, we introduce the idea of domain generalization considering the augmentation methods as pseudo-domains. Towards this, we investigate both domain-invariant and domain-aware approaches. Our LID system is based on the state-of-the-art emphasized channel attention, propagation, and aggregation based time delay neural network (ECAPA-TDNN) architecture. We have conducted extensive experiments with three widely used corpora for Indian LID research. In addition, we conduct a final blind evaluation of our proposed methods on the Indian subset of VoxLingua107 corpus collected in the wild. Our experiments demonstrate that the proposed domain diversification is more promising over commonly used simple augmentation methods. The study also reveals that domain generalization is a more effective solution than domain diversification. We also notice that domain-aware learning performs better for same-corpora LID, whereas domain-invariant learning is more suitable for cross-corpora generalization. Compared to basic ECAPA-TDNN, its proposed domain-invariant extensions improve the cross-corpora EER up to 5.23%. In contrast, the proposed domain-aware extensions also improve performance for same-corpora test scenarios.

研究の動機と目的

  • コーパス依存の非言語的バイアスのため、低リソースLIDシステムのクロスコーパス一般化性能が低いという問題に対処する。
  • 未観測で多様なテストコーパス上で評価される場合に、限られた社内コーパスで訓練されたLIDモデルの頑健性を向上させる。
  • 実世界のドメイン変動を模倣する効果的なデータ拡張戦略を開発する。
  • 実際のターゲットドメインデータが入手できない状況でも、拡張に基づく仮ドメインを用いたドメイン一般化を導入する。
  • 同じコーパス内とクロスコーパスの設定における最適なパフォーマンスを達成するため、ドメイン不変およびドメインに配慮した学習戦略を比較する。

提案手法

  • 複数の音声拡張手法(例:音声強化、コ덱ベース、ノイズ注入)を用いたドメイン多様化を提案し、訓練データの多様性を向上させる。
  • 多様性に最大限配慮した段階的拡張を導入し、最適化されたフォールドファクターを用いて多様性とモデル性能のバランスを図る。
  • 拡張タイプを仮ドメインとして扱うことで、実際のターゲットドメインデータが存在しない状況でもドメイン一般化(DG)を可能にする。
  • 勾配反転とMMDベースの損失を用いてドメイン固有の表現を最小化することで、ドメイン不変学習を実装する。
  • マルチタスク学習を用いてドメイン固有の特徴と言語固有の特徴を同時に学習できるようにすることで、ドメインに配慮した学習を実装する。
  • 最先端のDNNアーキテクチャであるECAPA-TDNNを用い、DG用に拡張したモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1音声データ拡張戦略は、未観測のドメイン変動を効果的に模倣でき、クロスコーパスLIDの一般化性能を向上させることができるか?
  • RQ2拡張タイプを仮ドメインとして扱うことで、低リソースLIDにおける有効なドメイン一般化が可能になるか?
  • RQ3クロスコーパス一般化において、ドメイン不変学習がドメインに配慮した学習よりも効果的であるか?
  • RQ4ドメイン多様化は、未観測コーパスにおけるブラインド評価において、標準的な拡張手法と比較して優れているか?
  • RQ5ドメイン一般化技術は、同じコーパス内とクロスコーパス評価の間のパフォーマンスギャップを縮小できるか?

主な発見

  • 最大限の多様性に配慮した段階的拡張を用いたドメイン多様化は、インド語部分集合であるVoxLingua107におけるブラインド評価で、従来の拡張手法を上回る性能を示した。
  • ドメイン一般化は、クロスコーパス一般化を顕著に向上させ、ベースラインのECAPA-TDNNと比較してEERを最大5.23%まで低減した。
  • ドメイン不変学習はクロスコーパス一般化においてより効果的である一方、ドメインに配慮した学習は同じコーパス内テストセットではより高いパフォーマンスを達成した。
  • 多様な拡張手法から導出された仮ドメインを用いることで、ラベル付きのターゲットドメインデータがなくても、効果的なドメイン一般化が可能になった。
  • 音声強化やコ덱ベースの拡張法は、KGPおよびLDCテストセットにおける頑健性向上に特に効果的であった。
  • 改善が見られたものの、依然として同じコーパス内とクロスコーパス評価の間で顕著なパフォーマンスギャップが残っており、より現実的なデータ拡張によりさらなる進歩が期待される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。