Skip to main content
QUICK REVIEW

[論文レビュー] ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models

Iman Mirzadeh, Keivan Alizadeh|arXiv (Cornell University)|Oct 6, 2023
Topic Modeling被引用数 7
ひとこと要約

この論文は、活性化スパarsityを活用するため、大規模言語モデル(LLM)におけるReLU活性化関数の再導入を提唱しており、推論におけるFLOPSを最大3倍まで削減しつつ、性能の低下を最小限に抑える。ReLUによる構造的スパarsityと、正規化後にReLU層を挿入することで、効率的な予測的デコードとモデル圧縮を実現し、計算リソースが制限された環境下でも、ReLUベースのLLMがより小さな密度型モデルを上回る効率性と精度を達成できることを示している。

ABSTRACT

Large Language Models (LLMs) with billions of parameters have drastically transformed AI applications. However, their demanding computation during inference has raised significant challenges for deployment on resource-constrained devices. Despite recent trends favoring alternative activation functions such as GELU or SiLU, known for increased computation, this study strongly advocates for reinstating ReLU activation in LLMs. We demonstrate that using the ReLU activation function has a negligible impact on convergence and performance while significantly reducing computation and weight transfer. This reduction is particularly valuable during the memory-bound inference step, where efficiency is paramount. Exploring sparsity patterns in ReLU-based LLMs, we unveil the reutilization of activated neurons for generating new tokens and leveraging these insights, we propose practical strategies to substantially reduce LLM inference computation up to three times, using ReLU activations with minimal performance trade-offs.

研究の動機と目的

  • GELU や SiLU のような滑らかでより複雑な代替手法への傾向がある中でも、LLMにおけるReLU活性化関数の再評価を目的とする。
  • 構造的活性化スパarsityを活用することで、ReLUベースのLLMが顕著な推論効率向上を達成できるかどうかを調査すること。
  • 微調整とアーキテクチャ変更を用いて、既存の非ReLU LLM(例:Llama、Falcon)のFLOPSを削減する実用的手法を検討すること。
  • 推論FLOPS制約下で、ReLUベースのモデルが同じFLOPS予算内でより小さな密度型モデルを上回る精度を達成できるかどうかを示すこと。
  • 活性化スパarsityの新たな応用、例えば予測的デコードのための集約スパarsityや、代替活性化関数設計のための事前活性化分析を同定すること。

提案手法

  • 推論効率を向上させるために、既存の非ReLU LLM(例:Llama、Falcon)をReLU活性化関数で微調整し、元の性能を回復させる。
  • 正規化層の後に追加のReLU層を挿入することで、活性化スパarsityをさらに強化し、FLOPSを削減する。
  • 集約スパarsityを活用して、自己回帰的生成を高速化するスパースな予測的デコードフレームワークを提案する。
  • ReLUで訓練されたモデルの事前活性化分布を活用し、代替スパース活性化関数(例:シフトされたReLU)の設計を支援する。
  • 「集約スパarsity」(トークン生成ステップ間で既に活性化されたニューロンの再利用)を測定・活用することで、余分な計算を削減する。
  • 構造的スパarsityパターン(例:重み行列の行全体をゼロ化)を適用し、特にメモリ制限が厳しい環境下でも、現代のハードウェアで推論を高速化する。
(a) Sparsity of different models
(a) Sparsity of different models

実験結果

リサーチクエスチョン

  • RQ1LLMにおけるReLUの使用は、モデル性能を損なわず、顕著な推論効率向上をもたらすか?
  • RQ2非ReLU LLM(例:Llama、Falcon)は、ReLU活性化関数で効果的に微調整可能であり、元の性能を回復させつつFLOPSを削減できるか?
  • RQ3活性化スパarsityは、自己回帰的生成における予測的デコードをどれほど高速化できるか?
  • RQ4事前活性化分布を用いて、性能を維持しつつスパarsityを最大化する代替スパース活性化関数を設計できるか?
  • RQ5FLOPS予算が同一の場合、ReLU化された大規模モデルは、より小さな密度型モデルを上回る精度を達成できるか?

主な発見

  • OPTモデルでは、活性化スパarsityが90%以上に達するため、推論FLOPSが6.6Gから4.5Gにまで最大32%削減された(1トークンあたり)。
  • 推論性能の低下を最小限に抑えつつ、推論と読解理解タスクで元の性能を回復させるために、非ReLU LLMをReLU活性化関数で微調整可能である。
  • 正規化後にReLU層を挿入し、集約スパarsityを活用することで、推論FLOPSが最大3倍まで削減された。
  • ReLUベースのモデルを用いたスパースな予測的デコードは、標準的な予測的デコードよりも高いスループットを達成し、特に生成速度γが高い場合に顕著であった。
  • ReLU化された大規模モデル(例:OPT 6.7B)は、同等のFLOPS予算下でより小さな密度型モデルを上回り、元のモデルスケーリング曲線を上回る性能を示し、ゼロショット精度が最大2%向上した。
  • 事前活性化分析により、トレーニング過程でReLUに類似した分布が自然に出現することが判明し、これにより、性能が標準ReLUと同等でありながら最大90%のスパarsityを達成できるシフトされたReLU関数の設計が可能になった。
(b) Sparsity for Efficiency
(b) Sparsity for Efficiency

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。