Skip to main content
QUICK REVIEW

[論文レビュー] Compressed Deep Networks: Goodbye SVD, Hello Robust Low-Rank Approximation

Murad Tukan, Alaa Maalouf|arXiv (Cornell University)|Sep 11, 2020
Tensor decomposition and applications参考文献 58被引用数 4
ひとこと要約

本稿では、特に埋め込み層を対象として、従来のSVDに基づく低ランク近似の代わりに、頑健な$\varepsilon$-近似$\mu$-ノルム低ランク近似を提案する。$p \in [1,2]$ の$\ell_p$-ノルムを用いることで、外れ値に対する耐性が向上し、圧縮下でも顕著に高い精度維持が達成される。例えば、RoBERTaの埋め込み層を28%圧縮した場合、SVDと比較して精度低下が0.63%にとどまる(SVDでは11%)。

ABSTRACT

A common technique for compressing a neural network is to compute the $k$-rank $\ell_2$ approximation $A_{k,2}$ of the matrix $A\in\mathbb{R}^{n imes d}$ that corresponds to a fully connected layer (or embedding layer). Here, $d$ is the number of the neurons in the layer, $n$ is the number in the next one, and $A_{k,2}$ can be stored in $O((n+d)k)$ memory instead of $O(nd)$. This $\ell_2$-approximation minimizes the sum over every entry to the power of $p=2$ in the matrix $A - A_{k,2}$, among every matrix $A_{k,2}\in\mathbb{R}^{n imes d}$ whose rank is $k$. While it can be computed efficiently via SVD, the $\ell_2$-approximation is known to be very sensitive to outliers ("far-away" rows). Hence, machine learning uses e.g. Lasso Regression, $\ell_1$-regularization, and $\ell_1$-SVM that use the $\ell_1$-norm. This paper suggests to replace the $k$-rank $\ell_2$ approximation by $\ell_p$, for $p\in [1,2]$. We then provide practical and provable approximation algorithms to compute it for any $p\geq1$, based on modern techniques in computational geometry. Extensive experimental results on the GLUE benchmark for compressing BERT, DistilBERT, XLNet, and RoBERTa confirm this theoretical advantage. For example, our approach achieves $28\%$ compression of RoBERTa's embedding layer with only $0.63\%$ additive drop in the accuracy (without fine-tuning) in average over all tasks in GLUE, compared to $11\%$ drop using the existing $\ell_2$-approximation. Open code is provided for reproducing and extending our results.

研究の動機と目的

  • NLPモデルの埋め込み行列における外れ値へのSVDベースの低ランク近似の感受性を軽減すること。
  • SVDベースの$\ell_2$-ノルム近似を、$p \in [1,2]$ のより頑健な$\ell_p$-ノルム近似に置き換えることで、モデル圧縮の効率を向上させること。
  • 深層ネットワーク圧縮における$\ell_p$-ベースの低ランク近似を計算する実用的で証明可能に正確なアルゴリズムを開発すること。
  • 頑健な低ランク近似が、微調整なしに複数のNLPベンチマークでSVDを上回ることを実証すること。
  • 再現性および提案された圧縮フレームワークの拡張を可能にするため、オープンソースコードを提供すること。

提案手法

  • 外れ値に対してより頑健な特性を有するために、標準的な$\ell_2$-ノルム低ランク近似(SVDによるもの)を、$p \in [1,2]$ の$\ell_p$-ノルム近似に置き換える。
  • 現代の計算幾何学的手法を用いて、$\ell_p$-ベースの$k$-ランク行列近似の実用的で証明可能な近似アルゴリズムを設計する。
  • 重み行列$A \in \mathbb{R}^{n \times d}$ を、より小さな行列$U \in \mathbb{R}^{n \times k}$ と $W \in \mathbb{R}^{k \times d}$ に因子分解することで、埋め込み層を圧縮し、メモリ使用量を$O(nd)$ から $O(k(n+d))$ に削減する。
  • $\ell_p$-ノルムの目的関数 $\|A - A_k\|_p^p = \sum_{i=1}^n \|A^{(i)} - A_k^{(i)}\|_p^p$ を用い、$\ell_2$-ノルムと比較して極端な値に対して感受性が低いように誤差を最小化する。
  • 二段階アプローチを採用する:第一段階では$\ell_p$-ノルムを用いた頑健な低ランク近似を計算し、第二段階では、微調整なしにその近似を埋め込み層の圧縮に適用する。
  • BERT、RoBERTa、XLNet、DistilBERTを用いてGLUEベンチマーク上で検証し、SVDと比較して精度と圧縮率を評価する。

実験結果

リサーチクエスチョン

  • RQ1SVDベースの$\ell_2$-ノルム近似と比較して、$p \in [1,2]$ の$\ell_p$-ノルム低ランク近似は、深層ニューラルネットワークにおける圧縮精度を向上させることができるか?
  • RQ2外れ値に対する$\ell_p$-ノルム近似の頑健性は、特に大規模語彙数または小規模モデルにおける圧縮時のモデル性能にどのように影響するか?
  • RQ3$\ell_p$-ベースの圧縮は、微調整なしに、モデル精度を維持するだけでなく向上させることができるか、その程度はどの程度か?
  • RQ4実世界のNLPモデルに対して、$\ell_p$-ベースの$k$-ランク近似を計算する際の実用的および理論的効率はどの程度か?
  • RQ5提案手法は、RoBERTa、XLNet、DistilBERTなどの異なるアーキテクチャに一般化可能か。特に、精度のボトルネックとなる埋め込み層においては?

主な発見

  • 提案された$\ell_p$-ベースの圧縮により、RoBERTaの埋め込み層を28%圧縮したが、GLUEタスク全体で平均して0.63%の精度低下にとどまり、SVDと比較して11%の低下と顕著な優位性を示した。
  • DistilBERTでは、外れ値に対する頑健性と小規模モデルにおける小さな誤差への感受性の高さが顕著に効果を発揮し、SVDを上回った。
  • RoBERTaでは、語彙サイズが非常に大きく(50,265個のサブワードユニット)、外れ値が発生しやすいため、$\ell_p$-ベースの手法が特に有効であった。
  • XLNetでは、相対的位置埋め込みが性能に重要な役割を果たすため、外れ値の影響が顕著であり、その結果、SVDよりも本手法が優れた性能を示した。
  • SST-2などの一部のタスクでは、低圧縮率の範囲で精度がわずかに向上した。これは、冗長な次元の除去によるものと推定される。
  • 本手法は、ほとんどのGLUEタスクおよび圧縮率において、SVDを常に上回り、優れた頑健性と精度維持性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。