Skip to main content
QUICK REVIEW

[論文レビュー] Kurdish (Sorani) Speech to Text: Presenting an Experimental Dataset

Akam Qader, Hossein Hassani|arXiv (Cornell University)|Nov 29, 2019
Linguistics and Cultural Studies参考文献 1被引用数 4
ひとこと要約

本論文では、イラク・クルド地域州の小学校1〜3年生の教科書から抽出した200語のコア文を用いて構築された、ソラニ・クルド語における自動音声認識(ASR)のための最初の実験的データセット、BD-4SK-ASRを紹介する。このデータセットはCMUSphinxフレームワークで開発され、34音素の音素セット、2,000件の合成文、トランスクリプション、ナレーションファイル(16ビット、モノ、16 kHz)、および言語モデルを含んでおり、前例のないASRリソースを有する低リソース言語における基礎的ASR研究を可能にする。

ABSTRACT

We present an experimental dataset, Basic Dataset for Sorani Kurdish Automatic Speech Recognition (BD-4SK-ASR), which we used in the first attempt in developing an automatic speech recognition for Sorani Kurdish. The objective of the project was to develop a system that automatically could recognize simple sentences based on the vocabulary which is used in grades one to three of the primary schools in the Kurdistan Region of Iraq. We used CMUSphinx as our experimental environment. We developed a dataset to train the system. The dataset is publicly available for non-commercial use under the CC BY-NC-SA 4.0 license.

研究の動機と目的

  • ソラニ・クルド語に特化した音声リソースの著しい不足に応えること。これは、前例のないASRシステムを有する低リソース言語である。
  • ソラニ・クルド語におけるASRシステムの訓練および評価のための基礎的データセットを構築すること。
  • CMUSphinxのような広く認知され、アクセスしやすいフレームワークを用いて、クルド語ASRにおける初期実験を支援すること。
  • 将来的により大きなコーパスおよび他のクルド語方言への拡張の基盤を築くこと。
  • CC BY-NC-SA 4.0ライセンスでリリースすることで、非営利研究を目的としたオープンサイエンスを推進すること。

提案手法

  • データセットは、イラクのクルド地域州の小学校1〜3年生のソラニ・クルド語教科書から抽出した200文から構築された。
  • ソラニ・クルド語の発音を正確に表現する目的で、独自に34音素の音素セットを定義した。この音素セットは、ペルシャ・アラビア文字と整合する。
  • 200の基本文をランダムに再結合することで、2,000件の合成文を生成し、語彙の繰り返しと訓練カバレッジを向上させた。
  • 音声録音は、静かな環境で1人の話者を用い、Audacityを用いて16 kHz、16ビット、モノ形式で収録し、ノイズ除去処理を施した。
  • 定義された音素セットを用いてトランスクリプションを作成し、CMUSphinx互換フォーマットに統合して音響モデルの訓練を可能にした。
  • 固定ディスカウント(0.5)と比率ベースバックオフを用いた言語モデルをCMUSphinxで構築し、283個のユニグラム、5,337個のビグラム、6,935個のトライグラムを含んだ。

実験結果

リサーチクエスチョン

  • RQ1小学校教育資料から抽出した小さな、選別されたデータセットを用いて、ソラニ・クルド語向けの基礎的ASRシステムを開発できるか?
  • RQ2低リソースのクルド語言語環境において、CMUSphinxを用いたASRシステムの訓練が実現可能か?
  • RQ3200の基本文から派生する2,000文の合成データセットが、初期ASR訓練を支援するためにどれほど有効か?
  • RQ4ASRパイプラインにおいて、ソラニ・クルド語を正確に表現するために必要な音声的および言語的要素は何か?
  • RQ5オープンで非営利のデータセットは、ソラニ・クルド語のような未開発言語技術分野における研究をどのように加速できるか?

主な発見

  • BD-4SK-ASRデータセットは、CC BY-NC-SA 4.0ライセンスで公開されており、非営利研究および開発を促進する。
  • データセットには34音素の音素セット、音声的フォーマットのトランスクリプション、16 kHz、16ビット、モノ、最小限の背景ノイズの2,000件の音声ファイルが含まれる。
  • 言語モデルには283個のユニグラム、5,337個のビグラム、6,935個のトライグラムが含まれており、文レベル認識のn-gram言語モデルをサポートする。
  • すべての録音に1人の話者を用いたことで一貫性が保たれたが、一般化能力に制限があることが示され、今後の研究では複数話者データの導入が求められる。
  • このデータセットは、ソラニ・クルド語ASRの最初の段階のベンチマークとして機能し、将来的により大規模かつ多様なコーパスへの拡張の基盤を提供する。
  • 著者らは、クルド語ASRに関する先行文献が存在しないことを確認しており、本研究が分野における最初の実験的試みであると位置づけている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。