Skip to main content
QUICK REVIEW

[論文レビュー] CSTNet: Contrastive Speech Translation Network for Self-Supervised Speech Representation Learning

Sameer Khurana, Antoine Laurent|arXiv (Cornell University)|Jun 4, 2020
Natural Language Processing Techniques参考文献 36被引用数 9
ひとこと要約

CSTNetは、手動のアノテーションを一切用いずに、音声から言語的表現を学習する自己教師あり対照学習フレームワークを提案する。ペアド音声翻訳データを活用し、対照学習によって畳み込み音声エンコーダーを訓練することで、対応するテキスト翻訳を検索するように学習させることで、意味的な音声的および言語的特徴を獲得する。このモデルは、電話認識タスクにおいて最先端の性能を達成し、従来手法に比べて最大8パーセンテージポイントのABX誤差率の低減を達成した。

ABSTRACT

More than half of the 7,000 languages in the world are in imminent danger of going extinct. Traditional methods of documenting language proceed by collecting audio data followed by manual annotation by trained linguists at different levels of granularity. This time consuming and painstaking process could benefit from machine learning. Many endangered languages do not have any orthographic form but usually have speakers that are bi-lingual and trained in a high resource language. It is relatively easy to obtain textual translations corresponding to speech. In this work, we provide a multimodal machine learning framework for speech representation learning by exploiting the correlations between the two modalities namely speech and its corresponding text translation. Here, we construct a convolutional neural network audio encoder capable of extracting linguistic representations from speech. The audio encoder is trained to perform a speech-translation retrieval task in a contrastive learning framework. By evaluating the learned representations on a phone recognition task, we demonstrate that linguistic representations emerge in the audio encoder's internal representations as a by-product of learning to perform the retrieval task.

研究の動機と目的

  • 音声と翻訳テキストのペアデータのみを用いて、言語的表現学習の自己教師あり学習フレームワークを開発すること。特に、表記が存在しない絶滅危惧言語への応用に特に適している。
  • 音声翻訳照合タスクを経て訓練された音声エンコーダーに言語的表現が出現するかどうかを調査すること。
  • 音声翻訳ペアに対する対照学習が、最先端のモデルと同等の高品質で低レベルの言語的表現を生成できることを示すこと。

提案手法

  • 原始波形から音声表現を抽出する畳み込みニューラルネットワーク(CNN)音声エンコーダーを訓練する。
  • モデルは対照学習フレームワークを採用し、一致する音声-翻訳ペアの埋め込みを一致させ、不一致ペアを遠ざけるように三重項損失を最適化する。
  • 音声-翻訳照合タスクのための共有埋め込みを生成するために、音声エンコーダーとテキストエンコーダーを同時に訓練する。
  • フレームワークは、英語音声とフランス語、ドイツ語、スペイン語、ポルトガル語、イタリア語への翻訳ペアを用いたMuST-Cデータセットで訓練される。
  • 下流タスクとして電話認識とABXタスクを評価し、言語的表現の質を測定する。
  • ABX誤差と電話認識性能に基づいて最良のモデルを選別し、音声エンコーダーの最終層から特徴量を抽出する。

実験結果

リサーチクエスチョン

  • RQ1音声と翻訳テキストのペアデータのみを用いた自己教師あり学習によって、音声エンコーダー内に言語的表現が出現するか?
  • RQ2音声-翻訳照合タスクを目的に音声エンコーダーを訓練することで、従来の自己教師あり手法に比べてより優れた音声的表現学習が達成できるか?
  • RQ3学習された表現の性能は、電話認識やABX評価などの下流タスクにおいて、最先端のモデルと比較してどうなるか?

主な発見

  • CSTNetモデルは、英語-フランス語ペアで訓練した場合、ZRC19英語テストセットで29.2%のABX誤差率を達成し、Wavenet-VQベースラインを8パーセンテージポイント上回った。
  • 最良の電話認識性能は、音声エンコーダーの最終層からの特徴量を用いることで達成され、英語-フランス語モデルを用いたWSJ eval92セットでは29.2%の音素誤差率(PER)を記録した。
  • 英語-フランス語ペアで訓練したモデルが、全言語ペアの中で最高の性能を示し、WSJデータセットにおける最良と最悪(英語-ドイツ語)のPER差は2.8パーセンテージポイントであった。
  • 音声-視覚データで訓練されていないにもかかわらず、CSTNetモデルは電話認識タスクでResDAVENetを6パーセンテージポイント上回った。
  • ネットワークの深さが増すにつれて電話認識性能が一貫して向上し、全言語ペアにおいて最終層が最高の性能を示した。
  • 結果から、特に音声的コンテンツを含む言語的情報が、音声エンコーダーの内部表現に効果的に符号化されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。