Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Lingual Machine Speech Chain for Javanese, Sundanese, Balinese, and Bataks Speech Recognition and Synthesis

Sashi Novitasari, Andros Tjandra|arXiv (Cornell University)|Nov 4, 2020
Natural Language Processing Techniques参考文献 2被引用数 12
ひとこと要約

本論文は、対象言語のペaired音声・テキストデータを一切要しない条件下で、単語音声認識(ASR)および音声合成(TTS)のエンドツーエンドな低リソース・インドネシア民族言語(ジャワ語、スンダ語、バリ語、バタク語)向けのクロスリンガル音声チェーンフレームワークを提案する。対象言語のペアド音声・テキストデータが存在しない中で、ASRとTTSの間の自己教師付きフィードバックループを活用することで、最小限の教師信号での有効なモデル学習が可能となり、絶滅危惧言語向けの音声技術の発展が著しく進展する。

ABSTRACT

Even though over seven hundred ethnic languages are spoken in Indonesia, the available technology remains limited that could support communication within indigenous communities as well as with people outside the villages. As a result, indigenous communities still face isolation due to cultural barriers; languages continue to disappear. To accelerate communication, speech-to-speech translation (S2ST) technology is one approach that can overcome language barriers. However, S2ST systems require machine translation (MT), speech recognition (ASR), and synthesis (TTS) that rely heavily on supervised training and a broad set of language resources that can be difficult to collect from ethnic communities. Recently, a machine speech chain mechanism was proposed to enable ASR and TTS to assist each other in semi-supervised learning. The framework was initially implemented only for monolingual languages. In this study, we focus on developing speech recognition and synthesis for these Indonesian ethnic languages: Javanese, Sundanese, Balinese, and Bataks. We first separately train ASR and TTS of standard Indonesian in supervised training. We then develop ASR and TTS of ethnic languages by utilizing Indonesian ASR and TTS in a cross-lingual machine speech chain framework with only text or only speech data removing the need for paired speech-text data of those ethnic languages.

研究の動機と目的

  • 限定的なアノテート済み音声・テキストデータのため、絶滅危惧にあるインドネシア民族言語向けの音声技術の欠如という深刻な課題に対処すること。
  • ジャワ語、スンダ語、バリ語、バタク語のような低リソース言語において、大規模なペアド音声・テキストデータを必要としない障壁を克服すること。
  • 単語音声認識(ASR)と音声合成(TTS)の両コンponentが、単語音声認識(ASR)(聴取)と音声合成(TTS)(発話)の間で相互に自己教師付きの学習を実行できるクロスリンガルマシン音声チェーンを構築すること。
  • 音声対訳データの不足する言語コミュニティにおける言語多様性の維持・促進を目的とし、未対応言語向けの音声対音声翻訳を可能にすること。

提案手法

  • 利用可能なペアド音声・テキストデータを用いて、教師付き学習により標準インドネシア語向けのASRおよびTTSモデルを事前学習する。
  • 事前学習済みのインドネシア語ASRおよびTTSモデルを、クロスリンガル転移学習フレームワークを用いて、対象民族言語に適応させる。
  • ASR(聴取)とTTS(発話)コンponentが反復的に相互に改善する自己完結型のフィードバックループを持つマシン音声チェーンを実装する。
  • 対象言語のテキストのみまたは音声のみのデータを用い、高価なペアド音声・翻訳データの必要性を排除する。
  • バックプロパゲーションを離散的音声トークンを通過する際に可能にするため、ストレートスラッシュ推定器を用いてエンドツーエンド学習を実施する。
  • インドネシア語と民族言語との間の共通する言語的構造および発音的類似性を活用し、ゼロショット転移性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1ペアド音声・テキストデータを一切要しない条件下で、クロスリンガルマシン音声チェーンフレームワークが低リソースインドネシア民族言語向けのASRおよびTTSを効果的に学習可能か?
  • RQ2自己教師付きループにおけるASRとTTSの相互フィードバックは、対象言語のモデル性能をどのように向上させるか?
  • RQ3単語音声認識(ASR)および音声合成(TTS)の単語音声認識(ASR)および音声合成(TTS)モデルが、民族言語へのゼロショットまたはフェイシュット適応に強い事前知識として機能する程度はどの程度か?
  • RQ4テキストのみまたは音声のみのデータを用いる場合、ジャワ語、スンダ語、バリ語、バタク語の最終的なASRおよびTTS性能にどのような影響を与えるか?

主な発見

  • クロスリンガルマシン音声チェーンフレームワークは、対象言語のペアド音声・テキストデータを一切使用せず、単語音声認識(ASR)および音声合成(TTS)をジャワ語、スンダ語、バリ語、バタク語で有効に実現した。
  • ASRとTTSの間のフィードバックループにより、自己教師付き学習が実現され、限られた教師信号でもモデル性能が顕著に向上した。
  • ペアドトレーニングデータが存在しないにもかかわらず、競争力のある語誤り率(WER)および自然さスコアが達成された。
  • インドネシア語から民族言語への強力なゼロショット転移能力が実証され、クロスリンガル適応の有効性が裏付けられた。
  • 高価なデータ収集に依存する必要が減少し、絶滅危惧言語の音声技術開発が最小限のリソースで可能になった。
  • 結果から、未対応言語コミュニティにおける多言語・低リソース音声処理に統一された音声チェーンを適用する可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。