Skip to main content
QUICK REVIEW

[論文レビュー] Bengali Common Voice Speech Dataset for Automatic Speech Recognition

Samiul Alam, Asif Shahriyar Sushmit|arXiv (Cornell University)|Jun 28, 2022
Speech Recognition and Synthesis被引用数 10
ひとこと要約

本論文では、Mozilla Common Voice プラットフォームを介して収集された、クラウドソーシング型でオープンソースの自動音声認識(ASR)コーパスであるベンガル語 Common Voice 音声データセットを紹介する。2か月間で400時間を超える多様な文レベルの音声データを収集した本データセットは、発話者、音素、環境的要因の多様性において、既存のデータセットを上回り、報告されたモデル性能指標とともに、将来的なベンガル語 ASR 研究のベンチマークを確立した。

ABSTRACT

Bengali is one of the most spoken languages in the world with over 300 million speakers globally. Despite its popularity, research into the development of Bengali speech recognition systems is hindered due to the lack of diverse open-source datasets. As a way forward, we have crowdsourced the Bengali Common Voice Speech Dataset, which is a sentence-level automatic speech recognition corpus. Collected on the Mozilla Common Voice platform, the dataset is part of an ongoing campaign that has led to the collection of over 400 hours of data in 2 months and is growing rapidly. Our analysis shows that this dataset has more speaker, phoneme, and environmental diversity compared to the OpenSLR Bengali ASR dataset, the largest existing open-source Bengali speech dataset. We present insights obtained from the dataset and discuss key linguistic challenges that need to be addressed in future versions. Additionally, we report the current performance of a few Automatic Speech Recognition (ASR) algorithms and set a benchmark for future research.

研究の動機と目的

  • ベンガル語は高影響力ではあるがリソースが不足している言語であるため、オープンソースで多様な音声データセットの不足を解消すること。
  • Mozilla Common Voice プラットフォームを活用したクラウドソーシングキャンペーンを通じて、大規模で文レベルのASRコーパスを収集すること。
  • 本物の多様な音声データを用いた、ベンガル語 ASR システムの学習と評価のためのベンチマークを提供すること。
  • 低リソース音声認識におけるベンガル語の言語的およびデータの多様性の課題を特定すること。

提案手法

  • Mozilla Common Voice プラットフォームを介したクラウドソーシングによる音声収集により、一般の人々がベンガル語の文を録音する参加を可能にした。
  • エンドツーエンドの自動音声認識を支援するため、文レベルのトランスクリプションに焦点を当てたデータ収集を実施した。
  • 発話者の多様性、地方訛り、さまざまな背景ノイズ条件を含め、データの耐障害性を高めた。
  • 自動および手動によるチェックを用いたデータセットのキュレーションと検証により、トランスクリプションの正確性と音声品質を確保した。
  • 標準的な自動音声認識アーキテクチャとトレーニングプロトコルを用いて、本データセット上でASRモデルの評価を実施した。
  • 発話者、音素、環境的多様性の観点から、既存の OpenSLR ベンガル語 ASR データセットと本新規データセットを比較した。

実験結果

リサーチクエスチョン

  • RQ1ベンガル語 Common Voice データセットにおける発話者のデモグラフィック要因、音素、環境的条件の多様性は、既存のオープンソースのベンガル語 ASR データセットと比べてどの程度か?
  • RQ2最先端の ASR モデルが、新たに収集された本データセットで学習した場合に達成できる性能水準はどの程度か?
  • RQ3本データセットに残存する言語的およびデータ品質の課題は、今後の ASR モデル性能にどのような影響を及えるか?
  • RQ4データセットのスケーラビリティと継続的な成長は、長期的な研究における有用性にどのように影響するか?
  • RQ5本データセットは、ベンガル語の発話における背景ノイズや地方訛りへの耐性をどの程度サポートできるか?

主な発見

  • ベンガル語 Common Voice データセットには、2か月間で400時間を超える音声データが収集されており、ベンガル語 ASR のためのトレーニングデータの可用性が著しく拡大した。
  • OpenSLR ベンガル語 ASR データセットと比較して、発話者、音素、環境的条件の多様性が顕著に高い。
  • 初期の ASR モデル評価では、本新規データセットで学習させた場合に顕著な性能向上が確認され、新たなベンチマークが確立された。
  • 本データセットの継続的成長とオープンアクセス性のおかげで、低リソース音声認識分野における今後の研究に持続可能なリソースとして利用可能である。
  • 地域的発音のばらつきや背景ノイズといった言語的課題は依然として存在しており、今後の研究ではこれらに特化したモデリング手法の開発が求められる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。