[論文レビュー] The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers
この論文は、訓練済みのトランスフォーマー・モデルにおける 'ラジオ・ニューロン' 現象を特定し、調査している。中間MLP活性化は、密行列計算にもかかわらず、非ゼロのエントリがたった3–6%にとどまるほど極めてスパースになる。このスパース性は、多様なアーキテクチャとデータセットで訓練中に自然に生じる。さらに、Top-kプルーニングによるより厳しいスパース性の強制も、性能の損失なしにモデルのロバストネス、キャリブレーション、効率性を向上させる。
This paper studies the curious phenomenon for machine learning models with Transformer architectures that their activation maps are sparse. By activation map we refer to the intermediate output of the multi-layer perceptrons (MLPs) after a ReLU activation function, and by sparse we mean that on average very few entries (e.g., 3.0% for T5-Base and 6.3% for ViT-B16) are nonzero for each input to MLP. Moreover, larger Transformers with more layers and wider MLP hidden dimensions are sparser as measured by the percentage of nonzero entries. Through extensive experiments we demonstrate that the emergence of sparsity is a prevalent phenomenon that occurs for both natural language processing and vision tasks, on both training and evaluation data, for Transformers of various configurations, at layers of all depth levels, as well as for other architectures including MLP-mixers and 2-layer MLPs. We show that sparsity also emerges using training datasets with random labels, or with random inputs, or with infinite amount of data, demonstrating that sparsity is not a result of a specific family of datasets. We discuss how sparsity immediately implies a way to significantly reduce the FLOP count and improve efficiency for Transformers. Moreover, we demonstrate perhaps surprisingly that enforcing an even sparser activation via Top-k thresholding with a small value of k brings a collection of desired but missing properties for Transformers, namely less sensitivity to noisy training data, more robustness to input corruptions, and better calibration for their prediction confidence.
研究の動機と目的
- なぜ訓練済みのトランスフォーマーにおける中間活性化が、密行列計算にもかかわらず極めてスパースになるのかを理解すること。
- このスパース性がデータセット固有の性質に起因するのか、それともアーキテクチャやデータタイプにかかわらず一般的な現象なのかを調査すること。
- スパース性がモデルの効率性、ロバストネス、キャリブレーションに与える影響を検討すること。
- Top-kプルーニングによるスパース性の強制が、モデルの一般化性能と信頼性を向上させるかどうかを特定すること。
- スパース性が明示的な正則化やスパース性誘導目的なしに、訓練ダイナミクスによってどのように生じるのかを説明すること。
提案手法
- 複数のトランスフォーマー・アーキテクチャとタスクにおいて、ReLU活性化後のMLP出力における非ゼロエントリの割合として活性化スパース性を測定する。
- 自然データ、ランダムデータ、無限データの上でモデルを学習し、スパース性の原因をデータ分布の影響から分離する。
- 幅が異なる二層のMLPと異なる最適化手法を用いて、より単純なモデルにおけるスパース性を研究し、一様なスパース性パターンを観察する。
- Top-kプルーニングを適用して極めてスパースな状態を強制し、下流タスクにおけるロバストネスとキャリブレーションを評価する。
- 初期化時の勾配ダイナミクスを分析し、スパース性の出現を訓練ダイナミクスと結びつける。
- 異なるモデルの深さ、幅、および学習/評価データの設定におけるスパース性を比較する。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマーにおける活性化スパース性は、異なるアーキテクチャ、タスク、データ分布においてどの程度一般化される現象なのか?
- RQ2スパース性はデータセットの特性に起因するのか、それとも訓練ダイナミクスによって駆動されるのか?
- RQ3モデルの幅、パラメータ化レジーム(不足・過剰・中間)と活性化スパース性の関係は何か?
- RQ4Top-kプルーニングによる極めてスパースな状態の強制は、モデルのロバストネスと信頼性のキャリブレーションを向上させるのか?
- RQ5明示的な正則化やスパース性誘導目的なしに、なぜトランスフォーマーでスパース性が生じるのか?
主な発見
- トランスフォーマーのMLP活性化におけるスパース性は極めて顕著である:T5-Baseでは平均で2.7%の非ゼロエントリ、ViT-B16では6.3%である。
- スパース性はモデルの深さと幅が増すにつれて増大し、より大きなモデルで顕著に現れる。
- 自然データおよびランダムデータ、さらには無限データ設定においてもスパース性が維持されるため、データ依存性ではない。
- 単純な二層MLPでもスパース性が生じるため、これはアーキテクチャ設計の性質ではなく、訓練ダイナミクスの性質であると考えられる。
- kが小さい(例:k=1または2)Top-kプルーニングにより、入力の破損に対するロバストネスが向上し、ノイズの多いラベルへの感受性が低下する。
- スパース性は、精度の低下なしに顕著なFLOP削減を可能にするとともに、より良い信頼性キャリブレーションと相関している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。