Skip to main content
QUICK REVIEW

[論文レビュー] A Compact End-to-End Model with Local and Global Context for Spoken Language Identification

Fei Jia, Nithin Rao Koluguri|arXiv (Cornell University)|Oct 27, 2022
Speech Recognition and Synthesis被引用数 4
ひとこと要約

TitaNet-LID は、1次元の深さ方向分離畳み込みとシグマ・エクスカーションモジュールを組み合わせることで、局所的およびグローバルなコンテキストを捉えるコン act なエンドツーエンドニューラルネットワークである。最先端の自己教師付き学習(SSL)モデルと比較して10倍小さいにもかかわらず、FLEURSベンチマークで88.2%の最先端の正確性を達成しており、短い発話(5秒未塔)に対しても、単純なファインチューニングによって頑健に動作する。

ABSTRACT

We introduce TitaNet-LID, a compact end-to-end neural network for Spoken Language Identification (LID) that is based on the ContextNet architecture. TitaNet-LID employs 1D depth-wise separable convolutions and Squeeze-and-Excitation layers to effectively capture local and global context within an utterance. Despite its small size, TitaNet-LID achieves performance similar to state-of-the-art models on the VoxLingua107 dataset while being 10 times smaller. Furthermore, it can be easily adapted to new acoustic conditions and unseen languages through simple fine-tuning, achieving a state-of-the-art accuracy of 88.2% on the FLEURS benchmark. Our model is scalable and can achieve a better trade-off between accuracy and speed. TitaNet-LID performs well even on short utterances less than 5s in length, indicating its robustness to input length.

研究の動機と目的

  • 話語識別(LID)のためのコンパクトでエンドツーエンドのニューラルネットワークを開発し、モデルサイズを最小限に抑えつつ高い正確性を維持すること。
  • 簡単なファインチューニングにより、未知の言語や新しい音声環境への効果的な適応を可能にすること。
  • 実世界の応用で一般的な短い音声セグメント(5秒未塔)に対しても強力な性能を発揮すること。
  • 計算リソースが制限された環境への展開を考慮し、正確性と推論速度のバランスを取れるスケーラブルなアーキテクチャを提供すること。
  • 自己教師付き事前学習を用いない軽量モデルが、はるかに大きなSSLベースのモデルと同等またはそれを上回る性能をLIDベンチマークで達成できることを示すこと。

提案手法

  • 局所的特徴を効率的に抽出するため、ContextNetを模したエンコーダーを採用し、1次元の深さ方向分離畳み込みを用いる。
  • チャネルごとの特徴応答を再キャリブレーションすることでグローバルコンテキストをモデル化するため、シグマ・エクスカーション(SE)層を統合する。
  • エンコーダーの後続に統計プーリング層と2つの全結合層を配置し、固定長の発話レベル表現を出力する。
  • アーキテクチャはスケーラブルである:モデルの深さは繰り返しブロック数(R)で調整可能で、幅はフィルタ数(C)で調整可能である。
  • モデルはVoxLingua107でエンドツーエンドでスクラッチから訓練され、FLEURSでファインチューニングされることで、未知の言語へのゼロショット一般化が可能になる。
  • 実装はNVIDIA NeMo経由で公開されており、容易な展開と適応が可能である。
Figure 1: TitaNet-LID- $B$ x $R$ x $C$ Encoder is based on ContextNet architecture [ 20 ] , where $B$ is the number of blocks, $R$ is the number of repeated ``basic” blocks and $C$ is the number of filters in the convolution layers of each block.
Figure 1: TitaNet-LID- $B$ x $R$ x $C$ Encoder is based on ContextNet architecture [ 20 ] , where $B$ is the number of blocks, $R$ is the number of repeated ``basic” blocks and $C$ is the number of filters in the convolution layers of each block.

実験結果

リサーチクエスチョン

  • RQ1局所的およびグローバルコンテキスト機構を備えたコンパクトでエンドツーエンドのモデルが、自己教師付き事前学習を用いずに話語識別で最先端の性能を達成できるか?
  • RQ2限定的なデータでファインチューニングされた場合、モデルは未知の言語や新しい音声環境にどの程度一般化できるか?
  • RQ3入力セグメント長の影響、特に短い発話(5秒未塔)においてモデルの正確性にどのような影響があるか?
  • RQ4モデルサイズをスケーリングすることで、異なる展開環境における正確性と推論速度のバランスを効果的に調整できるか?
  • RQ5軽量モデルの性能は、大規模なSSLベースのモデルと比較して正確性およびパラメータ効率の面でどの程度優れているか?

主な発見

  • TitaNet-LID-3x5x1024(2900万パラメータ)は、FLEURSベンチマークで88.2%のマクロ正確性を達成し、前回のSOTAモデルを16.8%上回った。
  • VoxLingua107では2890万パラメータで95.0%のマクロ正確性を達成し、2100万パラメータのECAPA-TDNN-LIDベースラインを上回った。
  • 短い発話(5秒未塔)に対しても、TitaNet-LIDは強力な性能を維持しており、入力長の変動に対して頑健であることが示された。
  • FLEURSとVoxLingua107の統合データでファインチューニングすることで、127言語を93.8%のマクロ正確性で予測可能となった。
  • XLS-R(0.3B)モデルの10倍小さいにもかかわらず、VoxLingua107で同等の性能を達成しており、w2v-bert-51(0.6B)の20倍小さいにもかかわらず、FLEURSでそれを上回った。
  • フィルタ数(C)とブロック繰り返し数(R)を増加させることでモデルをスケーリングすると正確性が向上し、TitaNet-LID-3x5x2048では95.9%のマクロ正確性を達成した。
Figure 2: Number of samples for each language in VoxLingua107 evaluation set. Dark blue represents accurately identified samples of TitaNet-LID-3x5x1024.
Figure 2: Number of samples for each language in VoxLingua107 evaluation set. Dark blue represents accurately identified samples of TitaNet-LID-3x5x1024.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。