[論文レビュー] Hindi-English Code-Switching Speech Corpus
本稿では、インドの多様な地域、性別、年齢層にまたがる71名の話者から構成される大規模なヒンディー語-英語(ヒングリッシュ)コードスイッチング音声コーパスを提示している。このコーパスは、自動音声認識(ASR)システムの学習および評価を支援するもので、3-gram言語モデルを用いたDNN音声モデルを用いて25.40%の語誤り率(WER)を達成しており、インドにおける低リソースコードスイッチングASR研究において顕著な貢献を果たしている。
Code-switching refers to the usage of two languages within a sentence or discourse. It is a global phenomenon among multilingual communities and has emerged as an independent area of research. With the increasing demand for the code-switching automatic speech recognition (ASR) systems, the development of a code-switching speech corpus has become highly desirable. However, for training such systems, very limited code-switched resources are available as yet. In this work, we present our first efforts in building a code-switching ASR system in the Indian context. For that purpose, we have created a Hindi-English code-switching speech database. The database not only contains the speech utterances with code-switching properties but also covers the session and the speaker variations like pronunciation, accent, age, gender, etc. This database can be applied in several speech signal processing applications, such as code-switching ASR, language identification, language modeling, speech synthesis etc. This paper mainly presents an analysis of the statistics of the collected code-switching speech corpus. Later, the performance results for the ASR task have been reported for the created database.
研究の動機と目的
- インドにおける自動音声認識(ASR)のための、大規模かつ多様なヒンディー語-英語コードスイッチング音声リソースの不足を解消すること。
- 発音、年齢、性別、地理的起源の違いを捉えた代表的な音声コーパスを構築し、コードスイッチングASRシステムの耐障害性を向上させること。
- 最先端のモデル(DNNや3-gram言語モデルなど)を用いたベンチマークASR実験を通じて、コーパスの妥当性を検証すること。
- 多言語のインドの文脈における、言語識別、音声合成、言語モデル作成などの下流応用を支援すること。
提案手法
- 21のインド諸州にまたがる71名のヒンディー語話者から7,005件の発話を収集し、地理的、年齢的、性別の多様性を確保した。
- 分野の専門家を介した構造化されたデータ収集プロトコルを用い、制御された環境で発話を記録し、文内および文間のコードスイッチングパターンをカバーした。
- 音声をMFCC特徴量で前処理し、音声モデルの性能向上を目的にLDAおよびSAT変換を適用した。
- Kaldiツールキットを用いてGMMおよびDNNベースの音声モデルを学習し、5,500件を学習用、1,505件をテスト用に分離した。
- IRSTLMツールキットを用いて11,566件の学習文に基づき3-gram言語モデルを構築し、コードスイッチド音声における言語理解を向上させた。
- 語誤り率(WER)を用いて性能を評価し、単語言語モデル、トライフォン、深層ニューラルネットワーク(DNN)モデルの比較を、異なる特徴セットを用いて行った。
実験結果
リサーチクエスチョン
- RQ1インドの多言語話者における自然なヒンディー語-英語コードスイッチング発話において、文内スイッチングと文間スイッチングの分布はどのようになっているか?
- RQ2話者のデモグラフィック要因(年齢、性別、地域)の違いが、ヒンディー語-英語コードスイッチド発話の音声的特徴にどのように影響するか?
- RQ3新規に作成されたヒンディー語-英語コードスイッチングコーパスにおいて、DNNベースの音声モデルの性能は、従来のGMMベースのモデルと比べてどうなるか?
- RQ4コードスイッチドテキストに基づき学習された3-gram言語モデルは、このコーパスにおけるASR精度をどの程度向上させることができるか?
主な発見
- コーパスには71名の話者(男性44名、女性27名)からなる7,005件の発話が含まれており、21のインド諸州および20歳から64歳までの年齢層をカバーしている。
- 地理的分布は、東部が40.84%、北部が30.98%、南部が18.33%、西部が9.85%であり、地域的な多様性を確保している。
- LDAおよびSAT特徴量を用いたDNNベースの音声モデルが、25.40%という最低の語誤り率を達成し、GMMベースのモデルを上回った。
- 最良のモデルは、5層の隠れ層(各1,024ノード)とtanh活性化関数を用い、ミニバッチサイズ128で20エポックにわたり学習された。
- 11,566文に基づき学習された3-gram言語モデルは、認識精度を顕著に向上させ、コードスイッチドASRにおける言語モデルの重要性を示した。
- コーパスは現在も収集が継続されており、今後の研究を想定したサイズおよび多様性の拡大が進められている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。