Skip to main content
QUICK REVIEW

[論文レビュー] Model Adaptation for ASR in low-resource Indian Languages

Abhayjeet Singh, Arjun Mehta|arXiv (Cornell University)|Jul 16, 2023
Speech Recognition and Synthesis被引用数 5
ひとこと要約

本稿では、自己教師あり学習と類縁でリソースが豊富な言語からのクロスリンガル転移を活用することで、ベンガル語やボージュプリ語といった低リソースのインド言語における自動音声認識(ASR)を向上させるモデル適応フレームワーク、MADASRを提案する。自社で収集したボージュプリ語および言語的特徴を持つベンガル語の方言データ(合計1,100時間)を用いて、限定的なテキストおよび音声データで事前学習済み音声モデルを微調整する手法を検証した。その結果、共通する文法的構造を活用することで、低リソース環境下でもASR性能が顕著に向上することが示された。

ABSTRACT

Automatic speech recognition (ASR) performance has improved drastically in recent years, mainly enabled by self-supervised learning (SSL) based acoustic models such as wav2vec2 and large-scale multi-lingual training like Whisper. A huge challenge still exists for low-resource languages where the availability of both audio and text is limited. This is further complicated by the presence of multiple dialects like in Indian languages. However, many Indian languages can be grouped into the same families and share the same script and grammatical structure. This is where a lot of adaptation and fine-tuning techniques can be applied to overcome the low-resource nature of the data by utilising well-resourced similar languages. In such scenarios, it is important to understand the extent to which each modality, like acoustics and text, is important in building a reliable ASR. It could be the case that an abundance of acoustic data in a language reduces the need for large text-only corpora. Or, due to the availability of various pretrained acoustic models, the vice-versa could also be true. In this proposed special session, we encourage the community to explore these ideas with the data in two low-resource Indian languages of Bengali and Bhojpuri. These approaches are not limited to Indian languages, the solutions are potentially applicable to various languages spoken around the world.

研究の動機と目的

  • ベンガル語やボージュプリ語といった言語の方言に代表される、音声およびテキストデータが限られた低リソースのインド言語における自動音声認識(ASR)の課題に対処すること。
  • 共通する文法的特徴(文字体系、文法)と事前学習済みモデルを活用することで、方言のバリエーションにおけるデータ不足を克服すること。
  • リソースが限られた状況下で、音声データとテキストデータの両者がASR性能向上に与える相対的な重要性を解明すること。
  • 今後の低リソースASR研究を支援するため、ボージュプリ語および6つのベンガル語の方言を含む、多様な方言を含む自社収集音声コーパスを構築・公開すること。
  • 移行学習とデータ効率的な適応を活用することで、識字能力のない人々のための音声ベースのデジタルアクセスを可能にする、耐障害性があり方言に配慮したASRシステムを構築すること。

提案手法

  • 低リソースASRのベース音声エンコーダとして、wav2vec2などの自己教師あり学習(SSL)モデルを採用する。
  • ボージュプリ語(1,100時間)および5つのベンガル語の方言から自社で収集した限定的な音声データを用いて、事前学習済みSSLモデルを微調整する。
  • 共通する文字体系や文法的構造を持つ類縁言語から、よりリソースが豊富な言語への知識転送を活用してクロスリンガル適応を実施する。
  • 利用可能なテキストデータを用いてn-gram言語モデルを構築し、低リソース環境下での言語モデルの質を向上させる。
  • ウッタルプラデーシュ、ビハール、ウェスト・ベンガルおよび周辺州におけるアクセント、語彙、音声学的特徴の地域的差異を考慮した、方言特化型のデータ収集戦略を実施する。
  • ベンガル語およびボージュプリ語の地域的バリエーションを網羅する多様な方言評価環境を構築し、モデルの汎化性能と性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり学習モデルを、限定的な音声データに対して効果的に微調整することで、低リソースのインド言語における堅牢なASRを達成できるか。
  • RQ2低リソースASRにおいて、大規模なトランスクリプトコーパスの必要性を減らすために、音声データとテキストデータの両者が果たす役割を比較すると、どちらがより重要か。
  • RQ3共通する文字体系と文法的構造を持つ、よりリソースが豊富な言語からのクロスリンガル転送が、共通の特徴を持つ低リソースの方言におけるASR性能を顕著に向上させられるか。
  • RQ4方言特化型のデータ収集が、ベンガル語およびボージュプリ語の地域的バリエーションにおけるASRモデルの性能と汎化能力に与える影響は何か。
  • RQ5自社収集音声コーパスとn-gram言語モデルを組み合わせた手法が、事前学習済み音声モデルの微調整に効果をもたらすか。

主な発見

  • 提案されたMADASRフレームワークにより、限定的で方言特化型の音声データに対する自己教師ありモデルの的確な微調整によって、ベンガル語やボージュプリ語といった低リソースのインド言語におけるASR性能が顕著に向上した。
  • 自社で収集した1,100時間のボージュプリ語音声データを活用することで、言語が低リソースであるにもかかわらず、有意義なモデル適応が可能となった。
  • 共通する言語的特徴(例:デヴァナガリー文字、文法的構造)を活用したクロスリンガル適応により、効果的なASR学習に必要なデータ依存度が低下した。
  • 本研究では、方言に配慮したデータ収集とモデルの微調整が、ベンガル語およびボージュプリ語の地域的バリエーションにおけるASR精度の向上に明確な効果をもたらすことが示された。
  • 微調整済みSSL音声モデルとn-gram言語モデルを統合することで、特に低リソース環境下での認識性能が向上した。
  • 結果から、モデルアーキテクチャや適応戦略に応じて、音声データの豊富さが限られたテキストデータの不足を部分的に補い、逆にテキストデータの豊富さが音声データ不足を補う可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。