[論文レビュー] CORAA: a large corpus of spontaneous and prepared speech manually validated for speech recognition in Brazilian Portuguese
本論文は、手動で検証された音声-字幕ペairを備えた、290.77時間にのぼる公開音声コーパスCORAA v1を紹介する。このコーパスは、自然な発話と準備された発話を含み、実世界の発話現象を考慮した強固なASRモデルの訓練を可能にする。微調整されたWav2Vec 2.0 XLSR-53モデルは、CORAAで24.18%の単語誤り率を達成し、Common Voiceでは20.08%を記録し、実世界の発話を含むポルトガル語ASR分野において顕著な進展を遂げた。
Automatic Speech recognition (ASR) is a complex and challenging task. In recent years, there have been significant advances in the area. In particular, for the Brazilian Portuguese (BP) language, there were about 376 hours public available for ASR task until the second half of 2020. With the release of new datasets in early 2021, this number increased to 574 hours. The existing resources, however, are composed of audios containing only read and prepared speech. There is a lack of datasets including spontaneous speech, which are essential in different ASR applications. This paper presents CORAA (Corpus of Annotated Audios) v1. with 290.77 hours, a publicly available dataset for ASR in BP containing validated pairs (audio-transcription). CORAA also contains European Portuguese audios (4.69 hours). We also present a public ASR model based on Wav2Vec 2.0 XLSR-53 and fine-tuned over CORAA. Our model achieved a Word Error Rate of 24.18% on CORAA test set and 20.08% on Common Voice test set. When measuring the Character Error Rate, we obtained 11.02% and 6.34% for CORAA and Common Voice, respectively. CORAA corpora were assembled to both improve ASR models in BP with phenomena from spontaneous speech and motivate young researchers to start their studies on ASR for Portuguese. All the corpora are publicly available at https://github.com/nilc-nlp/CORAA under the CC BY-NC-ND 4.0 license.
研究の動機と目的
- ASR研究におけるブラジルポルトガル語の自然発話データセットの不足に対処する。
- 大規模かつ手動で検証された音声-字幕コーパスを提供し、実世界の発話現象に強いASRモデルの構築を促進する。
- 不順応、埋め込み語、騒音環境などの要因に対応できるエンドツーエンドASRシステムの開発を支援する。
- 若手研究者を鼓舞するため、ポルトガル語ASR研究のためのベンチマークデータセットを提供する。
- 多言語および強固なASRシステムの構築を促進するため、多様な発話スタイルにおける標準化された評価を実現する。
提案手法
- ALIP、C-ORAL ブラジル I、Nurc-Recife、SP2010の4つの既存コーパスを統合し、一貫性のある字幕基準を適用した統一データセットを構築した。
- 人間のアノテーターによる音声-字幕ペアの手動検証を実施し、高品質な真値を確保した。
- ブラジルポルトガル語(290.77時間)とヨーロピアンポルトガル語(4.69時間)の両方の音声を含んだ。
- エンドツーエンドASR学習のため、事前学習済みのWav2Vec 2.0 XLSR-53モデルをCORAAコーパスで微調整した。
- 字幕の誤り分析を実施し、特に単語の交換と埋め込み語の誤認識が顕著な誤りタイプであることを特定した。
- テストおよび開発セットの見直しプロセスを開始し、字幕の正確性を向上させ、埋め込み語の表記を標準化した。
実験結果
リサーチクエスチョン
- RQ1大規模かつ手動で検証された音声コーパスは、特に自然発話に対応するブラジルポルトガル語ASRの性能をどのように向上させるか?
- RQ2自然発話や非公式な発話を含めることで、ASRモデルの耐性および一般化性能にどのような影響を与えるか?
- RQ3単語の交換、省略、埋め込み語などの一般的な誤りタイプが、実世界の発話におけるASRモデルの性能に与える影響は何か?
- RQ4CORAAで微調整されたWav2Vec 2.0ベースのモデルは、CORAAおよびCommon Voiceベンチマークの両方で最先端の性能を達成できるか、その程度は?
- RQ5埋め込み語の表記を標準化するルールをどのように洗練すれば、字幕の正確性とモデルの一般化性能を向上させられるか?
主な発見
- CORAAのテストセットにおいて、Wav2Vec 2.0 XLSR-53モデルは24.18%の単語誤り率を達成した。
- Common Voiceのテストセットでは、同じモデルが20.08%の単語誤り率を記録し、優れた一般化性能を示した。
- CORAAでは文字誤り率が11.02%、Common Voiceでは6.34%であり、文字レベルのアライメントにおいて優れた性能を示した。
- タイプ3の語の交換エラーが最も頻出する誤りタイプであり、その後に語の省略と追加が続く。
- 埋め込み語およびその誤表記が主な誤り要因であったため、より良い標準化ルールの整備が求められた。
- 包括的な誤り分析から、315件のテストサンプルでCERが0.7から12の間であったことが判明し、うち42件が語の交換エラーであった。これは、さらなるデータの精査が不可欠であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。