Skip to main content
QUICK REVIEW

[論文レビュー] TensorGPT: Efficient Compression of Large Language Models based on Tensor-Train Decomposition

Mingxue Xu, Yao Xu|arXiv (Cornell University)|Jul 2, 2023
Topic Modeling被引用数 6
ひとこと要約

この論文では、GPT-2のような大規模言語モデル(LLM)の埋め込み層をテンソル・トレイン分解(TTD)を用いて圧縮する新しい手法、TensorGPTを提案する。各トークン埋め込みを行列積状態(MPS)として扱うことで、高ランクの圧縮が可能となり、パrameter数を最大38.4倍まで削減し、3.31倍の圧縮率において元のGPT-2を上回る性能を達成した。これは高い忠実度と計算効率を示している。

ABSTRACT

High-dimensional token embeddings underpin Large Language Models (LLMs), as they can capture subtle semantic information and significantly enhance the modelling of complex language patterns. However, this high dimensionality also introduces considerable model parameters and prohibitively high model storage and memory requirements, which is particularly unaffordable for low-end devices. Targeting no extra training data and insufficient computation cases, we propose a training-free model compression approach based on the Tensor-Train Decomposition (TTD), whereby each pre-trained token embedding is converted into a lower-dimensional Matrix Product State (MPS). We then comprehensively investigate the low-rank structures extracted by this approach, in terms of the compression ratio, the language task performance, and latency on a typical low-end device (i.e. Raspberry Pi). Taking GPT family models (i.e. GPT-2 and CerebrasGPT) as case studies, our approach theoretically results in $46.89\%$ fewer parameters of the entire model, with a compression ratio $39.38 imes$ - $65.64 imes$ for the embedding layers. With different hyperparameter choices, the model compressed with our approach can achieve a comparable language task performance to the original model with around $2.0 imes$ embedding layer compression. This empirically proves the existence of low-rank structure in GPT family models, and demonstrates that about half of the parameters in the embedding layers are redundant.

研究の動機と目的

  • エッジデバイスへのデプロイを妨げる大規模言語モデル(LLM)の埋め込み層の高コストなストレージとパラメータ数を軽減すること。
  • 完全な再計算なしに、インクリメンタルな更新(例:新しいトークンの追加)をサポートする効率的で動的な埋め込み圧縮を可能にすること。
  • トークン埋め込みの効率的な保存および計算に、低ランクテンソル形式としての行列積状態(MPS)の使用を検討すること。
  • 下流の言語生成タスクにおける圧縮埋め込みの忠実度と性能を評価すること。

提案手法

  • 各トークン埋め込みを個別のテンソルとして扱い、テンソル・トレイン分解(TTD)を用いて分解し、行列積状態(MPS)表現を形成する。
  • 埋め込み行列全体を分解するのではなく、各行(トークン埋め込み)を独立してテンソル化し、TT形式で保存することで、局所的な更新を可能にする。
  • TT分解により、高次元の埋め込みを低ランクテンソルの系列として表現することで、パrameter数を削減する。
  • インferencing中に分散テンソル演算を用いて、圧縮された埋め込みをオンザフライで再構成し、効率的な計算を実現する。
  • 事前学習済みのGPT-2モデルの埋め込み層に直接TTDを適用することで、再学習を回避する。
  • 再構成忠実度指標(MAE、norm-MAE)とGLUE/MRPCにおける下流のテキスト生成損失を用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みモデルの再学習なしに、TTDを個々のトークン埋め込みに効果的に適用できるか?
  • RQ2全行列分解と比較して、個別トークン埋め込みの分解における再構成誤差の忠実度はどの程度か?
  • RQ3TT分解による埋め込み層の圧縮が、下流の言語生成性能を保持あるいは向上させるか?
  • RQ4本手法は、完全な再計算なしに、動的な語彙変更(例:新しいトークンの追加)を効率的に処理できるか?
  • RQ5MPSに基づく圧縮埋め込み形式は、分散的またはストリーミング形式で効率的に計算可能か?

主な発見

  • 提案手法は、GPT-2の埋め込み層に対して最大38.40倍の圧縮率を達成したが、高い再構成忠実度を維持した。
  • 3.31倍の圧縮率において、圧縮モデルはテキスト再構成タスクで元のGPT-2を上回り、テキスト生成損失が9.01であった。
  • トークン埋め込みの正規化平均絶対誤差(norm-MAE)は低く、圧縮表現における高い忠実度を示している。
  • 再構成誤差(MAE)の可視化では、誤差分布が非一様であることが示され、特定の埋め込み次元が圧縮に適している可能性を示唆している。
  • 各トークン埋め込みが独立してテンソル化され、保存可能であるため、動的語彙への適応性が示された。
  • TT形式が効率的かつ並列化可能なテンソル演算をサポートするため、埋め込みの分散計算が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。