Skip to main content
QUICK REVIEW

[論文レビュー] Generative Pre-Training for Speech with Autoregressive Predictive Coding

Yu-An Chung, James Glass|arXiv (Cornell University)|Oct 23, 2019
Speech Recognition and Synthesis参考文献 37被引用数 10
ひとこと要約

本論文は、大規模なラベルなしデータから転送可能な音声表現を学習するための自己教師付き生成的事前学習手法として、自己回帰的予測符号化(APC)を提案する。未来のスペクトログ램フレームを自己回帰的に予測するようにエンコーダーを訓練することにより、APCは豊富で汎用的な表現を学習し、音声認識、音声翻訳、話者識別において、ログメルスペクトログラムや他の手法を上回る性能を発揮する。また、下流タスクにおけるラベル付きデータ量とモデルサイズの要件を低減する。

ABSTRACT

Learning meaningful and general representations from unannotated speech that are applicable to a wide range of tasks remains challenging. In this paper we propose to use autoregressive predictive coding (APC), a recently proposed self-supervised objective, as a generative pre-training approach for learning meaningful, non-specific, and transferable speech representations. We pre-train APC on large-scale unlabeled data and conduct transfer learning experiments on three speech applications that require different information about speech characteristics to perform well: speech recognition, speech translation, and speaker identification. Extensive experiments show that APC not only outperforms surface features (e.g., log Mel spectrograms) and other popular representation learning methods on all three tasks, but is also effective at reducing downstream labeled data size and model parameters. We also investigate the use of Transformers for modeling APC and find it superior to RNNs.

研究の動機と目的

  • 大規模なラベルなしデータから、一般的で特化していない、かつ転送可能な音声表現を学習する生成的事前学習アプローチの開発。
  • 既存の自己教師付き手法がタスクに不要な変動を除去するが、未知の下流タスクにおいて有用な情報を失う可能性があるという制限の解消。
  • APCが元の信号情報の保持を図るが、多様な音声応用分野において強力な事前学習目的として機能するかの検証。
  • APCのバックボーンアーキテクチャとしてのTransformerとRNNの有効性の比較。
  • 特に1ショット学習における話者識別を想定した低リソース環境下でのAPC表現のデータ効率性とモデル効率性の調査。

提案手法

  • APCは自己回帰的目的を用い、エンコーダーが過去のフレーム $ x_k $ までを入力として、将来のフレーム $ x_{k+n} $ を予測する。予測値とターゲットフレーム間のL1損失を最小化する。
  • エンコーダーは、順方向RNN(GRU)または正弦波位置エンコーディングを備えたTransformerデコーダーブロックとして実装され、順序依存性をモデル化する。
  • 大規模なラベルなし音声データを用いて自己教師付きAPC目的で事前学習を実施し、グローバルおよびローカルな音声構造を保持する表現を学習する。
  • 下流タスクでは、事前学習済みエンコーダーを固定し、タスク固有のヘッド(例:ASRにはコンフォーマル層、SIDにはGRU + Softmax)を用いて微調整する。
  • APC表現が非常に線形分離可能であるという事実を活用し、事前タスク固有のインダクティブバイアスなしで多様なタスクに容易に適用可能である。
  • 実験では、ASR、音声翻訳、話者識別をカバーする標準ベンチマークを用いて、APCとログメルスペクトログラム、CPC、PASEを比較する。

実験結果

リサーチクエスチョン

  • RQ1APCは、ASR、音声翻訳、話者識別といった多様な下流タスクに有効な汎用的音声表現を学習できるか?
  • RQ2APCは、CPC や PASE といった既存の自己教師付き手法を、正確性とデータ効率の面で上回るか?
  • RQ3Transformerアーキテクチャは、音声表現学習におけるAPC目的のモデル化においてRNNよりも有効性が高いか?
  • RQ4APC表現は、下流タスクにおけるラベル付きデータ量とモデルパラメータ数の必要性をどの程度低減できるか?
  • RQ5特に1人または数人の話者に対して1〜2つの発話のみを用いる1ショット学習状況において、APC表現はどの程度有効か?

主な発見

  • T-APC(TransformerベースのAPC)は、音声翻訳で14.3 BLEUを達成し、S-Transformer(13.8)と段階的ASR+MTシステム(14.6)を上回る。
  • 話者識別では、1ショット学習(1話者あたり1発話)で17.6%の精度を達成し、ログメル(8.7%)のほぼ2倍に達する。
  • APC表現は、下流タスクにおけるラベル付きデータ量とモデルパラメータ数を削減し、優れたデータ効率性とモデル効率性を示す。
  • APCは、ASR、音声翻訳、話者識別という3つのタスクすべてにおいて、ログメルスペクトログラムや他の自己教師付き手法(CPC、PASE)を一貫して上回る。
  • データ量が少ない状況では、APCとベースラインとの性能差が拡大するため、APCの優れた一般化性能とデータ効率性が示される。
  • 他の手法と比較して、APC表現はより線形分離可能であることが判明し、多様なタスクへの転送可能性を裏付ける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。