Skip to main content
QUICK REVIEW

[論文レビュー] Matrix Compression via Randomized Low Rank and Low Precision Factorization

Rajarshi Saha, Varun Srivastava|arXiv (Cornell University)|Oct 17, 2023
Sparse and Compressive Sensing Techniques被引用数 5
ひとこと要約

本稿では、低ランク構造と低精度量子化の両方を同時に活用することで、最小限の精度損失で高い圧縮比を達成する行列圧縮アルゴリズム、LPLR(Low-Precision Low-Rank)を提案する。ランダム化スケッチを用いて低ランク基底を計算し、その基底ベクトルを量子化した後、行列の列をこの量子化された基底へ射影することで、1行列要素あたり1ビットの圧縮比を達成する。この手法は、画像圧縮、埋め込み分類、LLaMA-7b層圧縮の分野で、従来手法を上回るか同等の性能を発揮する。

ABSTRACT

Matrices are exceptionally useful in various fields of study as they provide a convenient framework to organize and manipulate data in a structured manner. However, modern matrices can involve billions of elements, making their storage and processing quite demanding in terms of computational resources and memory usage. Although prohibitively large, such matrices are often approximately low rank. We propose an algorithm that exploits this structure to obtain a low rank decomposition of any matrix $\mathbf{A}$ as $\mathbf{A} \approx \mathbf{L}\mathbf{R}$, where $\mathbf{L}$ and $\mathbf{R}$ are the low rank factors. The total number of elements in $\mathbf{L}$ and $\mathbf{R}$ can be significantly less than that in $\mathbf{A}$. Furthermore, the entries of $\mathbf{L}$ and $\mathbf{R}$ are quantized to low precision formats $--$ compressing $\mathbf{A}$ by giving us a low rank and low precision factorization. Our algorithm first computes an approximate basis of the range space of $\mathbf{A}$ by randomly sketching its columns, followed by a quantization of the vectors constituting this basis. It then computes approximate projections of the columns of $\mathbf{A}$ onto this quantized basis. We derive upper bounds on the approximation error of our algorithm, and analyze the impact of target rank and quantization bit-budget. The tradeoff between compression ratio and approximation accuracy allows for flexibility in choosing these parameters based on specific application requirements. We empirically demonstrate the efficacy of our algorithm in image compression, nearest neighbor classification of image and text embeddings, and compressing the layers of LlaMa-$7$b. Our results illustrate that we can achieve compression ratios as aggressive as one bit per matrix coordinate, all while surpassing or maintaining the performance of traditional compression techniques.

研究の動機と目的

  • 大規模行列の高コストなストレージと計算負荷を、その内在する低ランク構造を活用することで軽減すること。
  • 因子行列の低ランク近似と低精度量子化を同時に最適化する行列圧縮手法の開発。
  • フルSVDが実行不可能なメモリ制限やリアルタイム環境において、実用的な圧縮を可能にすること。
  • ビット予算制約下で、ナードな量子化や既存の低ランク手法を上回る圧縮効率と精度を達成すること。
  • 画像、NLP、モデル圧縮を含む多様な応用分野において、理論的誤差境界と実験的検証を提供すること。

提案手法

  • 行列Aの近似範囲基底を計算するためにガウス確率的スケッチを用い、計算コストをO(nd²)からO(ndm)に削減する。
  • 左因子Lの基底ベクトルを低精度フォーマット(例:1〜8ビット)に量子化し、ストレージを削減しながら構造的情報を保持する。
  • 最小二乗解を用いて、Aの列の近似射影を量子化された基底へ計算し、右因子Rを形成する。
  • 両因子LとRを低精度フォーマットで保存することで、A ≈ LRという低ランク近似を構築し、合計ストレージを最小化する。
  • フルSVDを回避するランダム化アルゴリズムを活用することで、GPUメモリに収まらない大規模行列へのスケーラビリティを実現する。
  • ストリーミング環境でのインクリメンタル更新を可能にするために、Woodbury行列恒等式を用いる。

実験結果

リサーチクエスチョン

  • RQ1ナードな量子化と比較して、ランダム化スケッチと低ランク要因の低精度量子化を組み合わせることで、より優れた圧縮効率が達成できるか?
  • RQ2低精度低ランク因子分解において、ターゲットランク、量子化ビット予算、近似誤差の間のトレードオフは何か?
  • RQ3LPLRは、画像圧縮、埋め込みの最近傍探索、LLM層圧縮といった実世界の応用で、どのように性能を発揮するか?
  • RQ4フルSVDが計算的に実行不可能な状況下で、LPLRは直接SVDベースの量子化を上回るのか?
  • RQ5量子化された低ランク構造が、下流タスクにおける一般化性能を向上させる正則化効果を提供するか?

主な発見

  • LPLRは1行列要素あたり1ビットという極めて低い圧縮比を達成し、ストレージ効率においてナードな量子化を大きく上回りながら、精度を維持または向上させる。
  • 画像圧縮において、2ビット精度でさえも、直接SVD量子化(DSVD)やナードな量子化よりも意味的特徴をよりよく保持する。
  • 画像およびテキスト埋め込みデータセットにおいて、LPLRは最近傍分類タスクでベースライン手法と同等または上回る性能を維持・超過する。
  • LLaMA-7bモデルの層圧縮において、LPLRは最小限の性能低下で高い圧縮を達成し、大規模言語モデル圧縮の実用性を示している。
  • 理論的誤差境界から、近似誤差が尾数の特異値の和と量子化誤差に比例して増大することを示しており、本手法のロバスト性を裏付けている。
  • メモリ制限のある状況下では、GPUメモリ制限によりフルSVDが実行不可能な場合、LPLRが唯一の実用的選択肢となり、SVDベースの代替手法を上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。