[論文レビュー] Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models
Pruner-Zero は、微調整を伴わずに、大規模言語モデルのためのシンボリックな pruning メトリクスを自動的に進化させる遺伝的プログラミングベースのフレームワークを導入する。重み、勾配、活性化の操作から構成される洗練された探索空間内で探索することで、人間の介入なしに高性能なメトリクスを発見し、LLaMA および LLaMA-2 において 50% のスパarsity で言語モデリングおよびゼロショットタスクにおいて SOTA の後処理 pruning 方法を上回る性能を達成する。
Despite the remarkable capabilities, Large Language Models (LLMs) face deployment challenges due to their extensive size. Pruning methods drop a subset of weights to accelerate, but many of them require retraining, which is prohibitively expensive and computationally demanding. Recently, post-training pruning approaches introduced novel metrics, enabling the pruning of LLMs without retraining. However, these metrics require the involvement of human experts and tedious trial and error. To efficiently identify superior pruning metrics, we develop an automatic framework for searching symbolic pruning metrics using genetic programming. In particular, we devise an elaborate search space encompassing the existing pruning metrics to discover the potential symbolic pruning metric. We propose an opposing operation simplification strategy to increase the diversity of the population. In this way, Pruner-Zero allows auto-generation of symbolic pruning metrics. Based on the searched results, we explore the correlation between pruning metrics and performance after pruning and summarize some principles. Extensive experiments on LLaMA and LLaMA-2 on language modeling and zero-shot tasks demonstrate that our Pruner-Zero obtains superior performance than SOTA post-training pruning methods. Code at: \url{https://github.com/pprp/Pruner-Zero}.
研究の動機と目的
- 大規模言語モデルのための効果的な pruning メトリクスを設計する際に生じる高い人的作業負荷と試行錯誤の問題に対処すること。
- 専門知識や微調整に依存しないようにすることで、最適な pruning メトリクスの自動発見を実現すること。
- pruning メトリクスと後処理後のモデル性能との間の構造的・機能的相関関係を調査すること。
- 後処理 pruning におけるシンボリックなメトリクス進化のためのスケーラブルでフォーマットに強い多様な探索空間の構築。
- 自動的かつシンボリックなメトリクス生成を通じて、LLM の効率的で高性能なモデル圧縮を実現すること。
提案手法
- 定義済みの操作と入力の探索空間からシンボリックな pruning メトリクスを進化させるための遺伝的プログラミングフレームワークを設計した。
- 探索空間には、重み(W)、勾配(G)、活性化(X)を入力とし、絶対値、乗算、最小最大スケーリング、要素ごとの関数などの単項演算(UOP)および二項演算(BOP)を含む。
- 集団の多様性を高め、早期収束を回避するために、逆転操作簡略化戦略を導入した。
- フレームワークは、キャリブレーションデータにおける検証損失を用いて候補メトリクスを評価し、高性能なメトリクスへの進化を導く。
- 選択、交差、変異を通じてシンボリックな式が進化し、適応度は後処理後のモデル性能によって決定される。
- 最終的なメトリクスは、進化プロセスで最も優れた個体から得られ、その後、微調整なしに LLM の pruning に適用される。

実験結果
リサーチクエスチョン
- RQ1人間が設計したヒューリスティクスなしに、自動フレームワークが LLM のための優れた pruning メトリクスを発見できるか?
- RQ2重み、勾配、活性化の操作の異なる組み合わせが pruning 性能にどのように影響を与えるか?
- RQ3シンボリックなメトリクスのどのような構造的特性が、高い後処理後のモデル精度と相関しているか?
- RQ4遺伝的プログラミングは、高次元空間における複雑で非線形な pruning メトリクスを効果的に探索・最適化できるか?
- RQ5進化したメトリクスは、精度とスパarsity の観点から、既存の SOTA 後処理 pruning 方法と比べてどのように異なるか?
主な発見
- Pruner-Zero は、||W| × |W|| × σ(|G|) というシンボリックな pruning メトリクスを発見し、50% のスパarsity で LLaMA および LLaMA-2 において SOTA の性能を達成した。
- 進化したメトリクスは、言語モデリングおよびゼロショットタスクの両方で、SparseGPT や Wanda、GBLM-Pruner などの既存の後処理 pruning 方法を上回った。
- フレームワークは、重みの大きさと勾配の大きさを組み合わせ、正規化(σ)を施すメトリクスが優れた性能を示すことを特定した。これは、勾配の感度と pruning 効果との強い相関関係を示唆している。
- 逆転操作簡略化戦略により、集団の多様性が向上し、収束が改善され、より強固なメトリクス発見が可能になった。
- 探索プロセスから、包括的な操作セットを用いることでフォーマットへの感受性が低下することが明らかになり、探索空間の設計が妥当であることが裏付けられた。
- 広範なアブレーション実験により、進化したメトリクスは複数のデータセットおよびタスクで強力な性能を維持しており、汎化能力が確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。