Skip to main content
QUICK REVIEW

[論文レビュー] AdaVAE: Exploring Adaptive GPT-2s in Variational Auto-Encoders for Language Modeling

Haoqin Tu, Zhongliang Yang|arXiv (Cornell University)|May 12, 2022
Topic Modeling被引用数 4
ひとこと要約

AdaVAEは、適応アダプタを用いてGPT-2をエンコーダーおよびデコーダーの両方として統合するパrameter効率の良いVAEフレームワークを提案する。これにより、潜在的注意機構(Latent Attention)を介して効果的な潜在空間学習が可能になる。訓練時におけるパラメータの14.66%しか有効化されないが、言語モデリングで最先端の性能を達成し、生成および分類タスクにおいても競争力のある性能を示す。

ABSTRACT

Variational Auto-Encoder (VAE) has become the de-facto learning paradigm in achieving representation learning and generation for natural language at the same time. Nevertheless, existing VAE-based language models either employ elementary RNNs, which is not powerful to handle complex works in the multi-task situation, or fine-tunes two pre-trained language models (PLMs) for any downstream task, which is a huge drain on resources. In this paper, we propose the first VAE framework empowered with adaptive GPT-2s (AdaVAE). Different from existing systems, we unify both the encoder\&decoder of the VAE model using GPT-2s with adaptive parameter-efficient components, and further introduce Latent Attention operation to better construct latent space from transformer models. Experiments from multiple dimensions validate that AdaVAE is competent to effectively organize language in three related tasks (language modeling, representation modeling and guided text generation) even with less than $15\%$ activated parameters in training. Our code is available at \url{https://github.com/ImKeTT/AdaVAE}.

研究の動機と目的

  • 大規模なVAEが事前学習済み言語モデル(PLM)を完全に微調整する際の高い計算コストと非効率なパラメータ使用を是正すること。
  • RNNベースの潜在融合手法の制限を克服し、PLM表現と互換性のある方法を設計することで、TransformerベースのVAEにおける潜在空間構築を改善すること。
  • 同じGPT-2アーキテクチャを用い、共有された単語埋め込み空間を採用することで、モデルの一貫性と効率性を実現するエンコーダーおよびデコーダーの統合。
  • 最小限のトレーニング可能なパラメータで、低リソース環境およびマルチタスク設定において効果的な表現学習と生成を可能にすること。

提案手法

  • GPT-2の前駆層とアテンションブロック出力の間に適応アダプタモジュールを挿入し、パラメータ効率の良い微調整を可能にする。
  • エンコーダー表現をアテンション計算に直接組み込むことで、意味的で整合性のある潜在コードをよりよく構築できる機構「Latent Attention」を提案する。
  • 一貫性を保つために、同じ単語埋め込み空間を共有する2つのパラメータ効率の良いGPT-2モデルを統合されたエンコーダーおよびデコーダーとして採用する。
  • 2つの潜在知識統合戦略を検討する:生成時に潜在ベクトルをデコーダーに条件づける、および隠れ状態にそれらを統合する。
  • 再パラメータ化を用いた変分推論の目的関数を採用し、エビデンス下界(ELBO)を最適化することで、エンドツーエンドの学習を可能にする。
  • すべての元のGPT-2パラメータを固定したままアダプタベースの微調整を適用し、トレーニング可能なパラメータを全パラメータの14.66%にまで大幅に削減する。

実験結果

リサーチクエスチョン

  • RQ1統合的かつパラメータ効率の良いGPT-2アーキテクチャが、性能を損なわず、VAEにおけるエンコーダーおよびデコーダーの両方として機能できるか?
  • RQ2標準的な潜在ベクトル注入と比較して、Latent Attentionは意味的で分離可能な潜在空間を構築する上でどれほど効果的か?
  • RQ3パラメータ効率の良いPLMを用いたVAEにおいて、エンコーダーとデコーダーの深さの最適なバランスは何か?
  • RQ4AdaVAEは、従来の「大規模VAE」モデルと比較して顕著に少ないトレーニング可能なパラメータで、言語モデリングにおいて最先端の性能を達成できるか?
  • RQ5AdaVAEは、低リソース分類および制御可能なテキスト生成を含む多様なNLPタスクにどれほど一般化できるか?

主な発見

  • WikiText-2データセットにおいて、テストのPerplexity(PPL)が15.49に達し、顕著に少ないトレーニング可能なパラメータで、以前の最先端モデルを上回る性能を示した。
  • 14.66%のパラメータが有効化された状態で-ELBOが125.56に達し、優れた最適化効率と表現学習能力を示した。
  • 潜在空間の補間および類推タスクにおいて、生成された文の間で滑らかな意味的および文法的遷移が確認され、分離可能で意味のある潜在表現であることが裏付けられた。
  • アブレーションスタディの結果、8層のエンコーダーと12層のデコーダーが最良の性能を示し、8層を超えると利得が減少する傾向が見られた。
  • 低リソーステキスト分類および制御可能な生成においても、強力な性能を維持しており、多様なNLPタスクにおける堅牢性が確認された。
  • アダプタの使用により、最小限の計算オーバーヘッドで効果的な微調整が可能となり、マルチタスク学習が可能で効率的になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。