Skip to main content
QUICK REVIEW

[논문 리뷰] Compressed Deep Networks: Goodbye SVD, Hello Robust Low-Rank Approximation

Murad Tukan, Alaa Maalouf|arXiv (Cornell University)|2020. 09. 11.
Tensor decomposition and applications참고 문헌 58인용 수 4
한 줄 요약

이 논문은 특히 임bedding 레이어를 압축하기 위해 기존의 SVD 기반 저랭크 근사 대신 강력한 $\varepsilon$-근사 $\mu$-노름 저랭크 근사를 제안한다. $p \in [1,2]$ 인 $\ell_p$-노름을 사용함으로써, 이상치에 대한 저항력 향상으로 인해 압축 시 더 뛰어난 정확도 유지가 가능해지며, 예를 들어 RoBERTa의 임베딩 레이어를 28%로 압축했을 때 정확도 저하가 0.63%에 불과한 반면 SVD는 11%에 이른다.

ABSTRACT

A common technique for compressing a neural network is to compute the $k$-rank $\ell_2$ approximation $A_{k,2}$ of the matrix $A\in\mathbb{R}^{n imes d}$ that corresponds to a fully connected layer (or embedding layer). Here, $d$ is the number of the neurons in the layer, $n$ is the number in the next one, and $A_{k,2}$ can be stored in $O((n+d)k)$ memory instead of $O(nd)$. This $\ell_2$-approximation minimizes the sum over every entry to the power of $p=2$ in the matrix $A - A_{k,2}$, among every matrix $A_{k,2}\in\mathbb{R}^{n imes d}$ whose rank is $k$. While it can be computed efficiently via SVD, the $\ell_2$-approximation is known to be very sensitive to outliers ("far-away" rows). Hence, machine learning uses e.g. Lasso Regression, $\ell_1$-regularization, and $\ell_1$-SVM that use the $\ell_1$-norm. This paper suggests to replace the $k$-rank $\ell_2$ approximation by $\ell_p$, for $p\in [1,2]$. We then provide practical and provable approximation algorithms to compute it for any $p\geq1$, based on modern techniques in computational geometry. Extensive experimental results on the GLUE benchmark for compressing BERT, DistilBERT, XLNet, and RoBERTa confirm this theoretical advantage. For example, our approach achieves $28\%$ compression of RoBERTa's embedding layer with only $0.63\%$ additive drop in the accuracy (without fine-tuning) in average over all tasks in GLUE, compared to $11\%$ drop using the existing $\ell_2$-approximation. Open code is provided for reproducing and extending our results.

연구 동기 및 목표

  • NLP 모델의 임베딩 행렬에서 이상치에 민감한 SVD 기반 저랭크 근사 문제를 해결하기 위해.
  • SVD 기반의 $\ell_2$-노름 근사 대신 $p \in [1,2]$ 인 더 강력한 $\ell_p$-노름 근사를 도입하여 모델 압축 효율을 향상시키기 위해.
  • 딥 네트워크 압축에서 $\ell_p$-기반 저랭크 근사를 계산하기 위한 실용적이고 증명 가능한 알고리즘을 개발하기 위해.
  • 강력한 저랭크 근사가 피팅 트레이닝 없이도 다양한 NLP 벤치마크에서 SVD를 능가하는 정확도 유지 성능을 보임을 입증하기 위해.
  • 제안된 압축 프레임워크의 재현 가능성과 확장 가능성을 위해 오픈소스 코드를 제공하기 위해.

제안 방법

  • 이상치에 대한 저항력 향상을 위해 표준 $\ell_2$-노름 저랭크 근사(SVD 기반)를 $p \in [1,2]$ 인 $\ell_p$-노름 근사로 대체함으로써.
  • 현대적인 계산 기하학 기법을 활용하여 $\ell_p$-기반 $k$-랭크 행렬 근사에 대한 실용적이고 증명 가능한 근사 알고리즘을 설계함으로써.
  • 가중치 행렬 $A \in \mathbb{R}^{n \times d}$ 를 두 개의 더 작은 행렬 $U \in \mathbb{R}^{n \times k}$ 와 $W \in \mathbb{R}^{k \times d}$ 로 분해하여 임베딩 레이어를 압축함으로써 메모리 용량을 $O(nd)$ 에서 $O(k(n+d))$ 로 줄임.
  • $\ell_p$-노름 목적함수 $\|A - A_k\|_p^p = \sum_{i=1}^n \|A^{(i)} - A_k^{(i)}\|_p^p$ 를 최소화하여 오차를 줄이고, $\ell_2$-노름보다 극단적 값에 덜 민감하도록 함.
  • 이중 단계 접근법을 사용함: 첫째, $\ell_p$-노름을 활용한 강력한 저랭크 근사를 계산함; 둘째, 피팅 트레이닝 없이도 임베딩 레이어에 적용함.
  • BERT, RoBERTa, XLNet, DistilBERT를 대상으로 GLUE 벤치마크에서 정확도와 압축률을 SVD와 비교하여 방법의 유효성을 검증함.

실험 결과

연구 질문

  • RQ1$p \in [1,2]$ 인 $\ell_p$-노름 저랭크 근사가 딥 네트워크에서 SVD 기반의 $\ell_2$-노름 근사보다 더 뛰어난 압축 정확도를 제공할 수 있는가?
  • RQ2$\ell_p$-노름 근사의 이상치에 대한 강력한 저항력이, 특히 대용량 어휘나 소형 모델에서 압축 시 모델 성능에 어떤 영향을 미치는가?
  • RQ3$\ell_p$-기반 압축이 피팅 트레이닝 없이도 정확도를 유지하거나 향상시킬 수 있는 정도는 어느 정도인가?
  • RQ4실제 NLP 모델에 대해 $\ell_p$-기반 $k$-랭크 근사를 계산하는 데 있어 실용적이고 이론적인 효율성은 어떠한가?
  • RQ5RoBERTa, XLNet, DistilBERT와 같은 다양한 아키텍처로 일반화가 가능한가? 특히 임베딩 레이어가 정확도에 대한 병목 현상이 되는 경우에 대해.

주요 결과

  • 제안된 $\ell_p$-기반 압축은 RoBERTa의 임베딩 레이어를 28%로 압축했을 때 GLUE 작업 평균 정확도 저하가 0.63%에 불과했으며, SVD 대비 11%의 저하를 보였다.
  • DistilBERT에서는 소형 모델에서의 작은 오차에 대한 민감성과 이상치에 대한 강력한 저항력 덕분에 SVD를 능가하는 성능을 보였다.
  • RoBERTa에서는 대용량 어휘 크기(50,265개의 서브워드 유닛)로 인해 이상치 발생 가능성이 증가했고, 이에 따라 $\ell_p$-기반 방법이 특히 효과적이었다.
  • XLNet에서는 상대적 위치 임베딩이 성능에 중요한 영향을 미치므로 이상치의 영향이 크며, 이에 따라 $\ell_p$-기반 방법이 SVD를 능가했다.
  • SST-2와 같은 일부 작업에서는 저압축 비율에서 정확도가 약간 향상되었으며, 이는 冗餘한 차원의 제거로 인한 것으로 보인다.
  • 대부분의 GLUE 작업과 압축 비율에서 이 방법은 SVD를 일관되게 능가하여 더 뛰어난 강력성과 정확도 유지 성능을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.