Skip to main content
QUICK REVIEW

[論文レビュー] Hyena Hierarchy: Towards Larger Convolutional Language Models

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|Feb 21, 2023
Topic Modeling被引用数 75
ひとこと要約

Hyenaは潜在的な長い畳み込みとゲーティングの再帰から構築されたサブ二次的でアテンションなしの演算子を提示し、長い文脈での推論を速くしつつ、計算量を削減してTransformer様の言語モデリング品質を達成する。

ABSTRACT

Recent advances in deep learning have relied heavily on the use of large Transformers due to their ability to learn at scale. However, the core building block of Transformers, the attention operator, exhibits quadratic cost in sequence length, limiting the amount of context accessible. Existing subquadratic methods based on low-rank and sparse approximations need to be combined with dense attention layers to match Transformers, indicating a gap in capability. In this work, we propose Hyena, a subquadratic drop-in replacement for attention constructed by interleaving implicitly parametrized long convolutions and data-controlled gating. In recall and reasoning tasks on sequences of thousands to hundreds of thousands of tokens, Hyena improves accuracy by more than 50 points over operators relying on state-spaces and other implicit and explicit methods, matching attention-based models. We set a new state-of-the-art for dense-attention-free architectures on language modeling in standard datasets (WikiText103 and The Pile), reaching Transformer quality with a 20% reduction in training compute required at sequence length 2K. Hyena operators are twice as fast as highly optimized attention at sequence length 8K, and 100x faster at sequence length 64K.

研究の動機と目的

  • Scaleでアテンションに匹敵できるサブ二次的演算子の探索を動機づける。
  • データ制御された長い畳み込みベースの演算子としてHyenaをゲーティングとともに導入する。
  • Hyenaが言語モデリングと長い文脈を要するタスクにおけるアテンションとの性能ギャップを縮めることを示す。
  • Hyenaの長いシーケンスと視覚タスクにおける効率の優位性をデモンストレーションする。
  • ベンチマークとデータセット全体でHyenaのスケーラビリティと一般性を評価する。

提案手法

  • Hyenaを、データ制御された演算子を形成する長い畳み込みの再帰と、乗算的ゲーティングを組み合わせて定義する。
  • 長い畳み込みを、ニューラル implicit 表現(FFNベースの窓)で実装された学習可能なフィルターを介して暗黙的にパラメータ化する。
  • FFTベースの高速畳み込みを用いてO(L log L)計算を実現し、演算子全体を実現化せずにHyenaを評価する。
  • 因果畳み込みとパディング戦略を用いて自己回帰設定の因果性を確保する。
  • Hyenaを、連想リコール、言語モデリング、視覚タスクにおける最先端のサブ二次的方法と比較する。
  • 非常に長いシーケンスでの速度向上を定量化するため、アテンションとFlashAttentionと比較して実行時間をベンチマークする。

実験結果

リサーチクエスチョン

  • RQ1サブ二次的でアテンションなしの演算子は、密なアテンションと同等の品質をスケールで達成できるか?
  • RQ2データ制御された長い畳み込みベースのアーキテクチャは、長い文脈推論タスクにおける性能ギャップをどの程度埋めるか?
  • RQ3長い畳み込みの異なるimplicitパラメトリゼーションは、スケーラビリティ、メモリ、精度にどのような影響を与えるか?
  • RQ4Hyenaは長いシーケンスにおいて、アテンションベースの方法と比較してどの程度効率性と速度向上を提供するか?
  • RQ5Hyenaは言語タスクを超えて、大規模画像分類などで有効か?

主な発見

  • HyenaはThe Pile上でTransformerベースのモデルと類似の困難度(perplexity)と下流パフォーマンスを、シーケンス長2Kで総FLOPを20%削減して達成する。
  • Hyenaはシーケンス長が8Kから64Kの範囲で、密なアテンションに対して最大で5倍から100倍の速度向上を達成する。
  • 335MパラメータのThe Pile上で、HyenaはFLOPを20%削減した状態でTransformerの困難度と同等を達成する。
  • HyenaはHyenaでTransformer様の品質を、アテンションとハイブリッド化せずにWikiText103とThe Pileで達成する。
  • 画像分類において、HyenaはAttentionレイヤを置換した場合、ImageNet-1k上でアテンションベースのViTの性能に匹敵する。
  • 長い連想リコールタスク全体で、implicit parametrizationsは他の長い畳み込み法より優れており、長いシーケンスと大規模語彙のときにより大きな利得が生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。