Skip to main content
QUICK REVIEW

[論文レビュー] General-purpose, long-context autoregressive modeling with Perceiver AR

Curtis Hawthorne, Andrew Jaegle|arXiv (Cornell University)|Feb 15, 2022
Generative Adversarial Networks and Image Synthesis被引用数 34
ひとこと要約

Perceiver ARは、オートレグレッシブでモダリティ非依存のアーキテクチャを導入し、クロスアテンションを用いて非常に長い入力を小さな潜在集合に圧縮し、潜在空間で深い自己注意を実行することで、標準のTransformerを超える真の長文脈密度推定を実現します。画像、書籍、音楽を横断する長文脈ベンチマークで最先端または競合的な結果を達成します。

ABSTRACT

Real-world data is high-dimensional: a book, image, or musical performance can easily contain hundreds of thousands of elements even after compression. However, the most commonly used autoregressive models, Transformers, are prohibitively expensive to scale to the number of inputs and layers needed to capture this long-range structure. We develop Perceiver AR, an autoregressive, modality-agnostic architecture which uses cross-attention to map long-range inputs to a small number of latents while also maintaining end-to-end causal masking. Perceiver AR can directly attend to over a hundred thousand tokens, enabling practical long-context density estimation without the need for hand-crafted sparsity patterns or memory mechanisms. When trained on images or music, Perceiver AR generates outputs with clear long-term coherence and structure. Our architecture also obtains state-of-the-art likelihood on long-sequence benchmarks, including 64 x 64 ImageNet images and PG-19 books.

研究の動機と目的

  • 非常に長い入力コンテキストを用いた汎用的な密度モデリングを動機づけ、可能にする。
  • 潜在ボトルネックを介して入力長と計算量を分離するオートレグレッシブなアーキテクチャを開発する。
  • 画像・テキスト・音楽など多様なドメインにわたり長距離依存性を捉えられることを示す。
  • 従来のデコーダーのみのTransformerおよびTransformer-XLに対するスケーラビリティの利点を示す。

提案手法

  • 大きな入力 X (Mトークン) を小さな潜在配列 Z (N 潜在) にマップするためにクロスアテンションを用いる。
  • 潜在に対して因果的にマスクされた自己注意のスタックを適用し、各ターゲットトークンの出力を生成する。
  • 自回帰順序を保持するためにターゲットごとに1つの潜在を割り当て、クロスアテンションと自己注意の両方で因果マスキングを適用する。
  • 入力長から計算を切り離しつつ全体のオートレグレッシブ因果性を維持し、複雑さはおおよそ O(MN) + O(LN^2) を達成する。
  • 長い文脈領域(画像、言語、音楽)で訓練・評価を行い、長距離の一貫性と密度推定を実証する。

実験結果

リサーチクエスチョン

  • RQ1オートレグレッシブモデルは、計算コストが高くなることなしに、非常に長い入力(例: >10^4 トークン)に対応できるか?
  • RQ2潜在ボトルネックを介して入力長と自己注意深度を分離することは、オートレグレッシブな依存性を保持し、スケーラビリティを向上させるか?
  • RQ3長文脈密度推定の観点で、画像・テキスト・音楽といった多様なモダリティに対してこの手法は有効か?
  • RQ4スケールにおける性能と効率の観点で、Perceiver ARとDecoder-only TransformerおよびTransformer-XLはどのように比較されるか?

主な発見

  • Perceiver ARは長文脈密度推定のために十万を超えるトークンに対処できる。
  • 64×64 ImageNet密度推定では、評価時に潜在の数を増やすとある段階まで bits/dim が改善され、テスト時の計算トレードオフを可能にする。
  • PG-19の言語モデリングでは、同じトークナイズノに対して従来の autoregressive モデルを上回り、文脈長が数千トークンまでスケールする。
  • Books (MassiveTest) および Wikitext-103 では、Perceiver AR は Transformer-XL のベースラインに匹敵するかそれを上回り、計算困難さも競争力のあるパープレキシティを示す。
  • MAESTROの記号・音声タスクでは、Perceiver AR は従来の音楽生成モデルより負の対数尤度が低く、長距離の一貫性を示す。
  • 潜在の数を変更するだけで再訓練なしにテスト時の計算を柔軟に調整でき、予算に応じた効率的なデプロイを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。