Skip to main content
QUICK REVIEW

[論文レビュー] Learning Low-Rank Approximation for CNNs

Dongsoo Lee, Se Jung Kwon|arXiv (Cornell University)|May 24, 2019
Sparse and Compressive Sensing Techniques参考文献 24被引用数 13
ひとこと要約

この論文では、元のモデル構造を変更せずに重みに低ランク近似に起因するノイズを注入することで、CNNの高圧縮低ランク近似を可能にする新しいトレーニング手法DeepTwistを提案する。元のアーキテクチャを維持することで、im2col変換を用いた効率的な2次元SVDが可能となり、特に高圧縮比において従来のファインチューニングを上回るモデル精度を達成する。DeepTwistを用いたタイル化SVDは、CIFAR-10およびImageNetベンチマークにおいて、Tucker分解を上回る性能を発揮する。

ABSTRACT

Low-rank approximation is an effective model compression technique to not only reduce parameter storage requirements, but to also reduce computations. For convolutional neural networks (CNNs), however, well-known low-rank approximation methods, such as Tucker or CP decomposition, result in degraded model accuracy because decomposed layers hinder training convergence. In this paper, we propose a new training technique that finds a flat minimum in the view of low-rank approximation without a decomposed structure during training. By preserving the original model structure, 2-dimensional low-rank approximation demanding lowering (such as im2col) is available in our proposed scheme. We show that CNN models can be compressed by low-rank approximation with much higher compression ratio than conventional training methods while maintaining or even enhancing model accuracy. We also discuss various 2-dimensional low-rank approximation techniques for CNNs.

研究の動機と目的

  • TuckerやCP分解のような従来の分解手法を用いた低ランク近似において、モデル精度の低下を解消すること。
  • トレーニング中に元のモデル構造を保持することで、CNNに対して効果的な2次元低ランク近似(例:SVD)を可能にすること。
  • 低ランク近似に起因するパラメータ誤差に対して頑健な平坦なミニマを探索するトレーニング戦略を開発すること。
  • im2col変換による低ランク近似とSVDベースの低ランク近似を組み合わせることで、圧縮効率と精度を向上させること。
  • SVDベースの手法がDeepTwistでトレーニングされた場合、Tucker分解を上回る精度と圧縮比を達成できることを示すこと。

提案手法

  • DeepTwistは、固定間隔($S_D$バッチごと)でネットワーク重みを低ランク近似(例:SVD)を用いて定期的に歪ませることで、モデル構造を変更せずにノイズを注入する。
  • この手法はトレーニング全体を通じて元のCNNアーキテクチャを維持するため、2次元SVDに適したim2colベースの低ランク近似と互換性を持つ。
  • 歪みステップでは重みテンソルに低ランク近似を適用し、分解されたテンソルの積を用いて再構成することで、パラメータ誤差をシミュレートする。
  • 損失関数の曲面が近似誤差に対して十分に平坦でない場合、重みを歪ませることで鋭いミニマから脱出する。
  • タイルサイズを固定(例:64×64)としてタイル化SVDを用い、各タイルを独立してランク$r$で分解することで、スケーラブルかつ効率的な低ランク近似を実現する。
  • 分解構造に対するファインチューニングの必要性を回避し、トレーニング後に変換されたモデルを直接デプロイ可能にする。

実験結果

リサーチクエスチョン

  • RQ1高圧縮比であっても、モデル精度を維持または向上させながら、低ランク近似をCNNに適用できるか?
  • RQ2TuckerやCP分解のような従来の低ランク手法は、ファインチューニングを行ってもなぜモデル精度を低下させるのか?
  • RQ3トレーニング中に低ランク近似のノイズを注入することで、低ランク近似に起因するパラメータ誤差に対して頑健な平坦なミニマを探索できるか?
  • RQ4元のモデル構造を保持することで、CNNにおいてim2col変換を用いた効果的な2次元SVDが可能になるか?
  • RQ5SVDとTucker分解を比較した場合、DeepTwistは従来のファインチューニングに比べて、精度と圧縮効率の両面で優れているか?

主な発見

  • VGG19(CIFAR-10)では、DeepTwistを用いたタイル化SVDが4.00×の圧縮を達成し、92.07%のトップ-1精度を記録。同程度の圧縮比においてTucker分解を上回る性能を示す。
  • VGG19では、DeepTwistを用いたタイル化SVDが2.00×の圧縮比で92.42%の精度を維持。事前学習済みモデルの92.37%を上回る。
  • ResNet-34(ImageNet)では、DeepTwistを用いたタイル化SVDが3.1×の圧縮比で73.00%のトップ-1精度を達成。Tucker分解の72.31%を上回る。
  • 元のモデル構造を保持することで、CNNにおいて効果的な2次元SVDが可能となり、im2colベースの低ランク近似技術を活用できる。
  • 従来のファインチューニングに比べ、DeepTwistは低ランク近似のトレーニング損失とテスト精度を、トレーニング全体で向上させる。
  • 歪み間隔$S_D$とタイルサイズの選定が最終精度にほとんど影響しないことから、頑健性が高く、デプロイが容易であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。