[論文レビュー] XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale
XLS-R は、436,000 時間にわたる多言語音声データ(128 言語)を用いて、大規模な wav2vec 2.0 フレームワークで自己教師付きで訓練されたクロスリンガル音声表現モデルである。これは、スティル翻訳(CoVoST-2 で 7.4 BLEU の向上)、音声認識(相対誤差率が 14–34% 減少)、言語識別において最先端の結果を達成しており、十分に大きなモデルの場合、英語から他の言語への翻訳において単言語モデルを上回っている。
This paper presents XLS-R, a large-scale model for cross-lingual speech representation learning based on wav2vec 2.0. We train models with up to 2B parameters on nearly half a million hours of publicly available speech audio in 128 languages, an order of magnitude more public data than the largest known prior work. Our evaluation covers a wide range of tasks, domains, data regimes and languages, both high and low-resource. On the CoVoST-2 speech translation benchmark, we improve the previous state of the art by an average of 7.4 BLEU over 21 translation directions into English. For speech recognition, XLS-R improves over the best known prior work on BABEL, MLS, CommonVoice as well as VoxPopuli, lowering error rates by 14-34% relative on average. XLS-R also sets a new state of the art on VoxLingua107 language identification. Moreover, we show that with sufficient model size, cross-lingual pretraining can outperform English-only pretraining when translating English speech into other languages, a setting which favors monolingual pretraining. We hope XLS-R can help to improve speech processing tasks for many more languages of the world.
研究の動機と目的
- 先行研究よりもはるかに多くの多言語データを用いて、クロスリンガル音声表現学習をスケールアップすること。
- 低リソースおよびミドルリソースの設定を含む、多様なタスク、言語、データ環境において、大規模な多言語モデルの性能を評価すること。
- 十分なモデル容量を持つクロスリンガル事前学習モデルが、通常は単言語事前学習に有利な英語から他の言語への音声翻訳において、単言語モデルと同等またはそれを上回る性能を達成できるかどうかを検証すること。
- 1つの多言語モデルが多様な音声処理タスクおよび低リソース言語にわたってどれほど一般化できるかを示すこと。
- 多言語音声処理分野の研究を促進するために、大規模で公開可能なモデルとコードベースをリリースすること。
提案手法
- XLS-R は、raw 音声から潜在表現を学習するための畳み込み特徴エンコーダーと、Transformer を用いたコンテキストエンコーダーを持つ wav2vec 2.0 フレームワークに基づいている。
- 対照的学習のため、潜在表現をコードブックエントリに離散化するために、Gumbel-Softmax 策略を用いた量子化モジュールが使用されている。
- 事前学習段階では、10 個の連続した時刻ステップがマスクされ、正解の量子化表現を 100 個のネガティブサンプルから予測する対照的目的関数を用いて学習が行われる。
- コードブックエントリの均等な使用を促進し、表現品質を向上させるために、コードブックの多様性ペナルティが適用されている。
- XLS-R は、VoxPopuli、MLS、CommonVoice、BABEL、VoxLingua107 から入手可能な未翻訳音声データを用いて、合計 128 言語の混合データセットで訓練されている。
- 微調整は、音声翻訳、ASR、言語識別などの下流タスクでエンドツーエンドに実行され、すべてのパラメータが更新される。

実験結果
リサーチクエスチョン
- RQ1436,000 時間のデータを 128 言語で用いて訓練された大規模な多言語自己教師付きモデルが、スティル翻訳および音声認識タスクにおいて、先行研究のクロスリンガルモデルを上回ることができるか?
- RQ2十分なモデル容量を持つクロスリンガル事前学習が、通常は単言語事前学習に有利な英語から他の言語への音声翻訳において、単語言語事前学習の性能を同等または上回ることができるか?
- RQ3モデルのスケーリングとデータの多様性が、多言語音声タスクにおける低リソース、ミドルリソース、ハイリソース言語の性能にどのように影響するか?
- RQ41つの多言語モデルが、音声処理分野の多様なドメインとデータ環境にどれほど一般化できるか?
- RQ5クロスリンガル事前学習が、特に低リソース言語において、言語識別で最先端の性能を達成できるか?
主な発見
- CoVoST-2 において、XLS-R は英語への 21 の翻訳方向すべてで平均して 7.4 BLEU の向上を達成し、特に低リソースおよびミドルリソース言語で顕著な向上を示した。
- 音声認識において、XLS-R は BABEL、MLS、CommonVoice、VoxPopuli において平均して 14–34% の相対誤差率削減を達成し、MLS を除くすべてのベンチマークで新たな最先端性能を樹立した。
- XLS-R は、VoxLingua107 の言語識別ベンチマークで新たな最先端性能を達成し、強力な多言語一般化能力を示した。
- 最大の XLS-R モデル(20億パラメータ)は、通常は単言語事前学習に有利な英語から他の言語への音声翻訳において、強力な英語専用事前学習モデルと同等またはそれ以上の性能を達成した。
- XLS-R は、VoxCeleb1 で 95.8% の発話者識別精度を達成し、先行研究を上回り、多数のデータが英語である状況でも強力な耐性を示した。
- 訓練データ量とモデル容量の増加に伴い、性能向上が一貫して見られ、他の要因が同一の場合、より大きなモデルがすべてのベンチマークで性能向上を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。