Skip to main content
QUICK REVIEW

[論文レビュー] MaSS: A Large and Clean Multilingual Corpus of Sentence-aligned Spoken Utterances Extracted from the Bible

Marcely Zanon Boito, William N. Havard|arXiv (Cornell University)|Jul 30, 2019
Natural Language Processing Techniques参考文献 28被引用数 17
ひとこと要約

本論文では、CMU Wilderness Multilingual Speech Dataset から抽出した、8言語(バスク語、英語、フィンランド語、フランス語、マジャール語、ルーマニア語、ロシア語、スペイン語)の8,130組の並列 spoken utterance を含む大規模かつ多言語の文単位で整列された音声コーパス、MaSS を紹介する。自動強制アラインメントと人間評価を適用することで、高品質な音声対音声および音声対テキストのアラインメントを構築し、二言語音声検索において中央値ランクがわずか9にまで低下することを示し、低リソースおよび構造的に多様な言語対においても実現可能性を裏付けた。

ABSTRACT

The CMU Wilderness Multilingual Speech Dataset (Black, 2019) is a newly published multilingual speech dataset based on recorded readings of the New Testament. It provides data to build Automatic Speech Recognition (ASR) and Text-to-Speech (TTS) models for potentially 700 languages. However, the fact that the source content (the Bible) is the same for all the languages is not exploited to date.Therefore, this article proposes to add multilingual links between speech segments in different languages, and shares a large and clean dataset of 8,130 parallel spoken utterances across 8 languages (56 language pairs). We name this corpus MaSS (Multilingual corpus of Sentence-aligned Spoken utterances). The covered languages (Basque, English, Finnish, French, Hungarian, Romanian, Russian and Spanish) allow researches on speech-to-speech alignment as well as on translation for typologically different language pairs. The quality of the final corpus is attested by human evaluation performed on a corpus subset (100 utterances, 8 language pairs). Lastly, we showcase the usefulness of the final product on a bilingual speech retrieval task.

研究の動機と目的

  • CMU Wildernessデータセットに含まれる700語以上の言語で共有されるソース素材(聖書)を活用して、大規模かつ高品質な多言語音声コーパスを構築すること。
  • 多様な言語対における並列発話の文単位整列を提供することで、音声対音声アラインメントおよび翻訳研究を可能にすること。
  • 8言語対の100件の発話を含む代表的サブセットに対して人間評価を実施することで、コーパスの品質を保証すること。
  • 学習済み音声埋め込みを用いた二言語音声検索タスクを通じて、コーパスの実用性を実証すること。
  • 新しい言語への拡張を支援するため、全パイプラインおよびアラインメントデータを公開すること。

提案手法

  • 著者らは、Kaldi を用いて8言語にまたがる発話と対応するテキスト発話の間で強制アラインメントを実行する。
  • 類似度を最小化するように、共通のマルチリンガル音声埋め込みを学習するため、シアンプス型ニューラルネットワークと対照的損失関数を用いる。
  • 損失関数は $ L(v_A, v_B, α) = \sum_{v_A,v_B} \Bigg{(} \sum_{v_A^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A^\prime,v_B)] + \sum_{v_B^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A,v_B^\prime)] \Bigg{)} $ で定義され、ここで $ d $ はコサイン距離、$ \alpha $ はマージンである。
  • モデルは、8,160の共通の聖句を80%の学習、10%の検証、10%のテストに分割して、バッチサイズ16、100エポックで学習する。
  • 8言語対の100件の発話を含むサブセットに対して、バイリンガルのネイティブスピーカーによる人間評価を実施し、アラインメント品質を評価する。
  • パイプラインおよびアラインメントスクリプトを公開し、新しい言語への容易な適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1共通のテキスト(例:聖書)を用いた自動強制アラインメントが、高品質で文単位整列された多言語音声コーパスを生成できるか?
  • RQ2自動アラインメントの品質と、音声対音声検索タスクにおける下流性能の相関関係はいかほどか?
  • RQ3マルチリンガル音声埋め込みは、構造的に多様な言語対において、効果的な二言語音声検索を可能にする程度はどの程度か?
  • RQ4人間評価が高コストである場合、音声対音声検索性能がアラインメント品質の代理指標として機能できるか?

主な発見

  • MaSSコーパスには、8言語にまたがる8,130組の並列発話が含まれており、高品質な文単位整列された音声対テキストおよび音声対音声アラインメントを有する56の言語対を形成している。
  • 100発話のサブセットに対する人間評価では、平均アラインメント品質スコアが5段階中4.44と高く、コーパスの信頼性が裏付けられた。
  • 音声対音声検索タスクにおいて、モデルはバスク語-英語対で中央値ランク9、スペイン語-英語対で12を達成し、ランダム(中央値ランク408.5)に比べ顕著に優れていた。
  • 検索中央値ランクと人間評価スコアの間に強い負の相関(r = -0.76、p < 0.1)が確認され、検索性能がアラインメント品質の代理指標として機能することが示唆された。
  • 特に構造的に遠く離れた言語対、例えばフィンランド語-英語(中央値ランク26)およびルーマニア語-英語(17)に対しても、音声対音声検索の実現可能性が示された。
  • パイプラインは拡張可能であり、同様の手法を用いて新しい言語への容易な適応が可能である、公開済みのスクリプトを備えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。