Skip to main content
QUICK REVIEW

[論文レビュー] Tensor Contraction Layers for Parsimonious Deep Nets

Jean Kossaifi, Aran Khanna|arXiv (Cornell University)|Jun 1, 2017
Tensor decomposition and applications参考文献 18被引用数 10
ひとこと要約

この論文は、活性化テンソルに対してテンソル畳み込みを適用することで次元削減とパラメータ数の削減を実現する、新しい微分可能なニューラルネットワーク層「テンソル畳み込み層(TCL)」を導入する。畳み込みネットワークにおける特徴マップの多次元的構造を活用することで、TCLはCIFAR100およびImageNetベンチマークで精度を維持あるいは向上させながら、最大92倍のモデル圧縮を実現する。

ABSTRACT

Tensors offer a natural representation for many kinds of data frequently encountered in machine learning. Images, for example, are naturally represented as third order tensors, where the modes correspond to height, width, and channels. Tensor methods are noted for their ability to discover multi-dimensional dependencies, and tensor decompositions in particular, have been used to produce compact low-rank approximations of data. In this paper, we explore the use of tensor contractions as neural network layers and investigate several ways to apply them to activation tensors. Specifically, we propose the Tensor Contraction Layer (TCL), the first attempt to incorporate tensor contractions as end-to-end trainable neural network layers. Applied to existing networks, TCLs reduce the dimensionality of the activation tensors and thus the number of model parameters. We evaluate the TCL on the task of image recognition, augmenting two popular networks (AlexNet, VGG). The resulting models are trainable end-to-end. Applying the TCL to the task of image recognition, using the CIFAR100 and ImageNet datasets, we evaluate the effect of parameter reduction via tensor contraction on performance. We demonstrate significant model compression without significant impact on the accuracy and, in some cases, improved performance.

研究の動機と目的

  • 深層ニューラルネットワークにおける本当に必要なパラメータ数を特定するという問いに応えるために、性能を損なわずモデルサイズを削減する手法を提案すること。
  • 特にテンソル畳み込みを含むテンソル代数的演算を、多次元データ構造を活用できる学習可能なレイヤーとして深層ネットワークに適用することの可能性を探ること。
  • 全結合層をテンソル畳み込み層に置き換えることで、顕著なパラメータ削減を達成しつつ、精度を維持または向上させられるかどうかを評価すること。
  • テンソル畳み込みが、畳み込みネットワークにおける平坦化と全結合層の代替として効果的であることを示し、構造的情報を保持するとともに、高速な推論を可能にすること。
  • TCLをAlexNet や VGG などの既存アーキテクチャに即座に統合できる「プラグアンドプレイ」モジュールとしての可能性を調査すること。

提案手法

  • 入力活性化テンソルに学習可能なプロジェクション要因を用いてnモードテンソル畳み込みを適用する、エンドツーエンドで学習可能な「テンソル畳み込み層(TCL)」を提案する。
  • nモード積分操作を適用:$\mathcal{G} = \mathcal{X} \times_1 \mathbf{U}^{(1)} \times_2 \cdots \times_N \mathbf{U}^{(N)}$ ここで $\mathcal{X}$ は入力活性化テンソル、$\mathbf{U}^{(n)}$ は学習可能なプロジェクション行列である。
  • テンソルの展開と行列乗算を用いて畳み込みを効率的に計算し、バックプロpagationをこのレイヤーを介して可能にする。
  • AlexNet および VGG の全結合層をTCLに置き換えることで、最終層のパラメータ数を削減しつつ、同等または向上した性能を維持する。
  • TCL搭載ネットワークのエンドツーエンド学習を保証するため、複数のGPUを用いたデータ並列化と標準的な学習プロトコルを採用する。
  • 平坦化処理を経ずに、最終畳み込み層からの3次元活性化テンソル(例:$\text{batch_size} \times 256 \times 5 \times 5$)に直接TCLを適用し、多次元的構造を保持する。

実験結果

リサーチクエスチョン

  • RQ1テンソル畳み込みを深層ニューラルネットワークにおける学習可能なレイヤーとして用いることで、モデルサイズを削減しつつ性能を維持できるか?
  • RQ2TCLは、画像認識タスクにおける精度を劣化させずに、全結合層のパラメータ数をどの程度削減できるか?
  • RQ3テンソル畳み込みによる活性化テンソルの多次元的構造の保持は、標準的な平坦化と全結合層と比較して、より優れたまたは安定した性能をもたらすか?
  • RQ4TCLは、ImageNetにおける大規模モデル(例:AlexNet)の圧縮にどの程度効果的か?また、精度の低下を最小限に抑えながら、高速な推論を可能にするか?
  • RQ5TCLは、アーキテクチャの再設計なしに、既存のアーキテクチャ(例:AlexNet や VGG)の全結合層の代替として「プラグアンドプレイ」で使用可能か?

主な発見

  • CIFAR100におけるAlexNetおよびVGGの最終畳み込み特徴マップにTCLを適用した結果、パラメータ数を最大92倍まで削減でき、全結合層を2つとも置き換えた場合でも精度の低下はたった2.5%にとどまった。
  • サイズを維持するTCLを全結合層の前に追加したところ、パラメータ数の増加はほとんどなく、性能はわずかに向上した。
  • 最初の全結合層をTCLに置き換えることで、パラメータ数を顕著に削減し、ImageNetにおけるベースラインAlexNetと同等のTop-1精度を維持した。
  • ImageNetにおいて、全結合層の前にTCLを追加したことで、パラメータ数の増加が最小限であったにもかかわらず、性能がわずかに向上した。
  • TCLは、精度の低下を最小限に抑えつつ顕著なモデル圧縮を実現し、構造的テンソル演算によるより良い表現学習のおかげで、一部のケースでは性能が向上した。
  • パラメータ数の削減に伴い、浮動小数点演算数が減少するため、推論が高速化される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。