Skip to main content
QUICK REVIEW

[論文レビュー] BT-Nets: Simplifying Deep Neural Networks via Block Term Decomposition

Guangxi Li, Jinmian Ye|arXiv (Cornell University)|Dec 15, 2017
Tensor decomposition and applications参考文献 27被引用数 12
ひとこと要約

この論文では、パrameterを著しく削減するために、完全結合(FC)層をブロック項(BT)分解を用いたブロック項(BT)層に置き換える新しい深層ニューラルネットワークアーキテクチャ、BT-Netsを提案する。入力・出力を低ランクテンソルに再形状し、BT分解を適用することで、ImageNet上で最小限の精度低下で11,000倍を超える圧縮比を達成する。微調整を必要とせず、テンソルトレイン(TT)手法を上回る圧縮性能と精度保持性能を実現する。

ABSTRACT

Recently, deep neural networks (DNNs) have been regarded as the state-of-the-art classification methods in a wide range of applications, especially in image classification. Despite the success, the huge number of parameters blocks its deployment to situations with light computing resources. Researchers resort to the redundancy in the weights of DNNs and attempt to find how fewer parameters can be chosen while preserving the accuracy at the same time. Although several promising results have been shown along this research line, most existing methods either fail to significantly compress a well-trained deep network or require a heavy fine-tuning process for the compressed network to regain the original performance. In this paper, we propose the extit{Block Term} networks (BT-nets) in which the commonly used fully-connected layers (FC-layers) are replaced with block term layers (BT-layers). In BT-layers, the inputs and the outputs are reshaped into two low-dimensional high-order tensors, then block-term decomposition is applied as tensor operators to connect them. We conduct extensive experiments on benchmark datasets to demonstrate that BT-layers can achieve a very large compression ratio on the number of parameters while preserving the representation power of the original FC-layers as much as possible. Specifically, we can get a higher performance while requiring fewer parameters compared with the tensor train method.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)のパrameter数の多さにより、リソース制約のあるデバイスへの展開が困難であるという課題に対処すること。
  • 既存の手法(例:テンソルトレイン(TT))と比較して、テンソル分解がより高い圧縮比を達成できるかどうかを検討すること。
  • ランクの変動に内在的に耐性を持つレイヤー構造を設計することで、微調整の必要を排除すること。
  • 完全結合層におけるパrameter数を著しく削減しながら、BT層が精度を維持または向上させることを実証すること。

提案手法

  • 重み行列をテンソルとして表現するブロック項(BT)分解を用いたBT層に、標準的な完全結合(FC)層を置き換える。
  • BT分解を適用する前に、入力および出力活性化を低次元の高次元テンソルに再形状する。
  • CPランク(R_C)とタッカー・ランク(R_T)の2種類のランクを用い、BT層の複雑さと表現能力を制御する。
  • BT分解を、タッカー分解とCANDECOMP/PARAFAC分解を組み合わせたテンソル演算子として適用し、指数的表現力の向上を実現する。
  • BT層の可換性を活用し、TT層とは異なりランクの最適化が不要である。
  • 微調整を追加で行わず、BT分解の構造的頑健性に依存して、エンドツーエンドでネットワークを学習する。

実験結果

リサーチクエスチョン

  • RQ1ブロック項分解は、既存のテンソル分解手法(例:テンソルトレイン)と比較して、完全結合層において顕著に高い圧縮比を達成できるか?
  • RQ2パrameter数を著しく削減しても、BT層は標準的なFC層の表現力を維持または向上させられるか?
  • RQ3TTベースのネットワークとは異なり、ランク設定が感受性であるにもかかわらず、BT-Netsは微調整を必要とせずに高い圧縮を達成できるか?
  • RQ4CPランクとタッカー・ランクがBT層の精度とパrameter数にどのように同時に影響を与えるか?
  • RQ5ベースラインのFC層およびTT層と比較して、BT-Netsにおける圧縮、精度、推論・学習時間のトレードオフはどのようなものか?

主な発見

  • ImageNetにおいて、最良のBT層構成('4-BT2')は、1つのFC層で6400×4096から2,368パラメータにまで圧縮し、圧縮比11,070を達成した。これはTT8(2,528の圧縮比)を上回った。
  • '4-BT2'構成はTop-1精度56.48%、Top-5精度79.69%を達成し、微調整なしでベースライン(Top-1: 56.17%、Top-5: 79.62%)と比較してわずかに優れた性能を示した。
  • '1-BT2'構成は、2.2%のTop-5精度低下で44,000倍を超える圧縮を達成し、圧縮性能および精度の両面で'TT2'を上回った。
  • ランクが小さい場合、BT層は顕著な推論速度向上を示した。ランクをベースライン性能に合わせて増加させると、学習および推論時間はFC層に近づいた。
  • 実験により、CPランクとタッカー・ランクを増加させると精度が向上するが、ある値を超えると効果の逓減が見られ、過剰なランクはコアテンソルの指数的スケーリングによりパラメータ数の急増を引き起こすことが確認された。
  • BT層の可換構造により、TT層とは異なり微調整の必要がなく、TT層が「オリーブ型」のランク分布を示すのとは対照的に、ランクチューニングに注意を払う必要がなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。