Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised Development of ASR Systems for Multilingual Code-switched Speech in Under-resourced Languages

Astik Biswas, Emre Yılmaz|arXiv (Cornell University)|Mar 6, 2020
Speech Recognition and Synthesis参考文献 24被引用数 8
ひとこと要約

本論文は、5つの南アフリカ諸語におけるリソースが乏しい多言語混合音声の自動音声認識(ASR)を改善するためのバッチ単位の半教師あり学習手法を提案する。未字幕で手動でセグメンテーションされたドラマ音声を活用し、二言語および五言語ASRシステムを用いて仮ラベルを生成することで、語誤り率(WER)を顕著に低減した。バッチ単位の学習が非バッチ単位の学習を上回り、特に二言語システムは五言語システムが生成した仮ラベルからより大きな恩恵を受けた。

ABSTRACT

This paper reports on the semi-supervised development of acoustic and language models for under-resourced, code-switched speech in five South African languages. Two approaches are considered. The first constructs four separate bilingual automatic speech recognisers (ASRs) corresponding to four different language pairs between which speakers switch frequently. The second uses a single, unified, five-lingual ASR system that represents all the languages (English, isiZulu, isiXhosa, Setswana and Sesotho). We evaluate the effectiveness of these two approaches when used to add additional data to our extremely sparse training sets. Results indicate that batch-wise semi-supervised training yields better results than a non-batch-wise approach. Furthermore, while the separate bilingual systems achieved better recognition performance than the unified system, they benefited more from pseudo-labels generated by the five-lingual system than from those generated by the bilingual systems.

研究の動機と目的

  • リソースが乏しい多言語混合語の南アフリカ語音声のASRパフォーマンスを、限定的な字幕データのもとで向上させること。
  • 南アフリカのドラマから得た未字幕で手動でセグメンテーションされた音声データを用いた半教師あり学習の有効性を評価すること。
  • 二つのアプローチを比較すること:4つの別個の二言語ASRと、1つの統合された五言語ASRシステムを用いた仮ラベル生成。
  • バッチ単位の学習とワンパス学習のASRパフォーマンスへの影響を調査すること。
  • 人工的に生成された混合語テキストおよび合成トライグラムが言語モデルの改善に寄与するかどうかを評価すること。

提案手法

  • 2つの学習設定を用いた:53時間の未字幕で手動でセグメンテーションされた混合語音声に対するワンパス学習とバッチ単位の半教師あり学習。
  • 4つの二言語ASR(英語-isiZulu、英語-isiXhosa、英語-Setswana、英語-Sesotho)と、5言語すべてをカバーする1つの五言語ASRシステムを用いて仮ラベルを生成した。
  • 仮ラベルを用いて音声認識モデルと言語モデルを再学習し、バッチ単位の再学習が収束性とパフォーマンスの両面で向上したことを確認した。
  • 実際の字幕に加えて、人工的に生成された混合語テキストと合成トライグラムを用いて言語モデルを構築し、パーセプレキシティを低減した。
  • 開発セットおよびテストセットにおける語誤り率(WER)と混合語ビグラム正答率(CSBA)を用いてパフォーマンスを評価した。
  • 南アフリカのドラマから得た21時間のアノテーション付き混合語語彙を、学習と評価の基盤とした。

実験結果

リサーチクエスチョン

  • RQ1リソースが乏しい混合語音声に対して、バッチ単位の半教師あり学習はワンパス学習よりも優れたASRパフォーマンスをもたらすか?
  • RQ2別個の二言語ASRシステムと統合された五言語ASRシステムを比較した場合、認識正答率とデータスパarsityへの耐性はどのように異なるか?
  • RQ3五言語システムが生成する仮ラベルは、二言語システムが自らの仮ラベルを生成するのと比べて、二言語ASRシステムのパフォーマンスにどの程度向上効果をもたらすか?
  • RQ4人工的に生成された混合語テキストおよび合成トライグラムは、言語モデルのパーセプレキシティを顕著に低減し、WERを改善できるか?
  • RQ5特にバントゥー語認識に与える影響を考慮すると、多言語ASRシステムにおける言語バイアス(特に英語へのバイアス)の影響は何か?

主な発見

  • バッチ単位の半教師あり学習は、二言語および五言語ASRシステムの両方において、ワンパス学習よりも語誤り率(WER)をより効果的に低減した。
  • 二言語ASRシステムは、五言語システム(テストセットで31.3%)よりも低い全体的なWER(テストセットで30.3%)を達成し、バントゥー語認識で優れたパフォーマンスを示した。
  • 高い複雑性にもかかわらず、五言語システムはテストセットで31.3%のWERを達成し、固有の言語の曖昧さが存在する中でも強力なパフォーマンスを示した。
  • 五言語システムは英語への強いバイアスを示し、英語のWER(28.2%)はバントゥー語(例:isiZuluで52.7%)よりも顕著に低かったが、二言語システムはよりバランスの取れた性能を示した。
  • 人工的に生成されたテキストと合成トライグラムを用いた言語モデル学習により、WERが1.2ポイント低下(31.3%から30.1%)し、混合語ビグラム正答率は7.4ポイント上昇(42.3%から49.7%)した。
  • 二言語システムは、五言語システムが生成した仮ラベルから、自ら生成した仮ラベルよりも顕著に高い恩恵を受けた。これは、五言語システムが低リソース言語ペアに対してより高品質なトランスクリプションを提供していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。