Skip to main content
QUICK REVIEW

[論文レビュー] Audio ALBERT: A Lite BERT for Self-supervised Learning of Audio Representation

Po-Han Chi, Pei-Hung Chung|arXiv (Cornell University)|May 18, 2020
Speech Recognition and Synthesis参考文献 27被引用数 39
ひとこと要約

Audio ALBERT (AALBERT) はパラメータ効率の高い自己教師付き音声モデルで、層間で重みを共有し、Mockingjayと同等の音素・話者分類性能を約91% fewer parametersで達成する;中間層はより多くの音素・話者情報をエンコードする。

ABSTRACT

For self-supervised speech processing, it is crucial to use pretrained models as speech representation extractors. In recent works, increasing the size of the model has been utilized in acoustic model training in order to achieve better performance. In this paper, we propose Audio ALBERT, a lite version of the self-supervised speech representation model. We use the representations with two downstream tasks, speaker identification, and phoneme classification. We show that Audio ALBERT is capable of achieving competitive performance with those huge models in the downstream tasks while utilizing 91\% fewer parameters. Moreover, we use some simple probing models to measure how much the information of the speaker and phoneme is encoded in latent representations. In probing experiments, we find that the latent representations encode richer information of both phoneme and speaker than that of the last layer.

研究の動機と目的

  • 限られたリソースでのデプロイを可能にするため、音声表現の効率的な自己教師付き学習を動機付ける。
  • 音声トランスフォーマーにALBERTスタイルの重み共有を適用してパラメータ効率を調査する。
  • Mockingjayと比較するために音素・話者分類でAALBERTを評価する。
  • 層別表現を調べて、どこで音素と話者情報がエンコードされているかを理解する。

提案手法

  • 層間でパラメータを共有することで、Transformerベースの音声モデル(Audio ALBERT)にALBERTスタイルの重み共有を適用する。
  • cmvnを用いて対数線形スペクトログラムを回復するマスク付きスペクトログラム再構成で事前学習する、特定のマスキング/ノイズ方式と共に。
  • 特徴抽出設定とファインチューニング設定で、音素・話者分類においてAALBERTをMockingjay(12L/6L/3L)と比較する。
  • 層 acrossの音素と話者情報を評価するために、様々な複雑さのプロービング分類器を使用する。
  • 層ごとの冗長性と情報エンコードを理解するためにアテンション分布を分析する。
(a) Average
(a) Average

実験結果

リサーチクエスチョン

  • RQ1軽量で重み共有されたTransformer(AALBERT)は、大規模な事前学習済み音声モデル(Mockingjay)とダウンストリーム性能をほぼ同等に保ちつつ、パラメータを大幅に削減できるか?
  • RQ2事前学習済み音声モデルのどの層が最も音素と話者情報をエンコードしているか?
  • RQ3層の深さはAALBERTとMockingjayの音素・話者プロービング性能にどのように影響するか?
  • RQ4アテンション分布はAudio ALBERTにおけるパラメータ共有と層冗長性について何を示しているか?

主な発見

  • AALBERTはMockingjayと比べて音素分類精度はほぼ同等だが、パラメータを91%削減。
  • AALBERTはダウンストリームの話者分類性能も、Mockingjayよりはるかに少ないパラメータで達成(例:12L構成で7.4M対84.3M)。
  • プロービングから、中間層には最後の層より多くの音素・話者情報が含まれることが分かった。
  • 両モデルとも中間表現は音素・話者プロービングタスクで最後の層より優れている。
  • アテンション分析は層間の冗長性を示し、パラメータを圧縮しても表現品質を損なわない重み共有の合理性を支持する。
(b)
(b)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。