[論文レビュー] Foundation Transformers
この論文では、自然言語、視覚、音声、マルチモーダルタスクのあらゆる分野において、アーキテクチャと学習安定性を統一する Foundation Transformer の変種である Magneto を紹介する。Sub-LayerNorm と理論的根拠に基づく初期化戦略を提案することで、BERT や GPT、ViT、BEiT-3 といった実質的な Transformer の変種と比較して、優れた性能と向上した学習安定性を達成している。
A big convergence of model architectures across language, vision, speech, and multimodal is emerging. However, under the same name "Transformers", the above areas use different implementations for better performance, e.g., Post-LayerNorm for BERT, and Pre-LayerNorm for GPT and vision Transformers. We call for the development of Foundation Transformer for true general-purpose modeling, which serves as a go-to architecture for various tasks and modalities with guaranteed training stability. In this work, we introduce a Transformer variant, named Magneto, to fulfill the goal. Specifically, we propose Sub-LayerNorm for good expressivity, and the initialization strategy theoretically derived from DeepNet for stable scaling up. Extensive experiments demonstrate its superior performance and better stability than the de facto Transformer variants designed for various applications, including language modeling (i.e., BERT, and GPT), machine translation, vision pretraining (i.e., BEiT), speech recognition, and multimodal pretraining (i.e., BEiT-3).
研究の動機と目的
- 多様なモダリティやタスクにわたる統一的で汎用的な Transformer アーキテクチャの欠如に対処する。
- 特にスケーリングに伴う大規模な Transformer モデルにおける学習不安定性を克服する。
- タスク固有のチューニングなしに、自然言語、視覚、音声、マルチモーダル応用において優れた性能を発揮する単一のバックボーンアーキテクチャを開発する。
- 理論的導出に基づく初期化とアーキテクチャ的革新を通じて、学習安定性を確保する。
- 多様な下流タスクにおいて、より高い学習率とより強固な最適化を可能にする。
提案手法
- 各サブレイヤー(自己注意機構とフィードフォワードネットワーク)の入力および出力投影の前に、追加の LayerNorm を追加する Sub-LayerNorm(Sub-LN)を提案する。
- Wang ら(2022a)の DeepNet に基づく新しい初期化スキームを導入し、モデルの深さとアーキテクチャータイプに応じた調整可能なゲイン値を採用する。
- Transformer ブロック内のすべての線形投影にこの初期化を適用し、クエリ/キーの投影とフィードフォワード・出力の投影で異なるゲイン係数を設定する。
- 自然言語、視覚、音声、マルチモーダルのあらゆるモダリティにわたって、同じアーキテクチャと初期化を適用し、アーキテクチャの再チューニングを行わない。
- Sub-LN と初期化による安定性を活用して、より高い学習率を許容する標準的な最適化手順に従い、エンドツーエンドでモデルを学習する。
- マスクド言語モデリング(BERT)、因果的言語モデリング(GPT)、機械翻訳、マスクド画像モデリング(BEiT)、音声認識(T-T)、視覚言語事前学習(BEiT-3)の多様なタスクで手法を評価する。
実験結果
リサーチクエスチョン
- RQ1アーキテクチャの特化なしに、自然言語、視覚、音声、マルチモーダルタスクのあらゆる分野で最先端の性能を達成できる単一の Transformer アーキテクチャは可能か?
- RQ2Post-LN や Pre-LN の変種と比較して、Sub-LayerNorm は表現力と最適化安定性を向上させるか?
- RQ3理論的根拠に基づく初期化戦略は、特に深層モデルにおいてスケーリングに伴う安定した学習を保証できるか?
- RQ4提案された Foundation Transformer は発散を防ぎながら、より高い学習率を許容できるか?これにより学習効率が向上するか?
- RQ5視覚言語タスクのようなマルチモーダル事前学習において、統一アーキテクチャはモダリティ特化型の変種を上回る性能を発揮できるか?
主な発見
- 12層および24層モデルにおいて、ImageNet の検証セットで Pre-LN ベースラインをそれぞれ 0.4% と 0.6% 上回り、ImageNet のあらゆるバージョンで ViT を上回った。
- ADE20k のセマンティックセグメンテーションでは、12層モデルで 52.2% の mIoU、24層モデルで 54.6% の mIoU を達成し、バニラ ViT よりもそれぞれ 0.8% と 1.0% 高い性能を示した。
- 音声認識(LibriSpeech 960h)では、18L および 36L の両設定で Pre-LN ベースラインと比較して WER を 6% 以上低減した。
- 視覚言語タスクでは、テストスタンダードスプリットで VQA の正確性が 0.5% 向上し、テストセットで NLVR2 の正確性が 0.8% 向上した(Pre-LN と比較)。
- 36L モデルでは、Magneto は最大 3e-3 の学習率を許容する一方、Pre-LN ベースラインは 1.5e-3 に制限されるため、最適化安定性の優位性が明確に示された。
- 評価されたすべてのモダリティにおいて一貫した性能向上が確認され、Magneto が真の汎用的基盤アーキテクチャとしての役割を果たしていることが裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。