Skip to main content
QUICK REVIEW

[論文レビュー] Tensor Regression Networks with various Low-Rank Tensor Approximations

Xingwei Cao, Guillaume Rabusseau|arXiv (Cornell University)|Dec 27, 2017
Tensor decomposition and applications参考文献 14被引用数 17
ひとこと要約

本稿では、低ランクテンソル近似(CP、Tucker、テンソルトレイン(TT))を用いたテンソル回帰ネットワーク(TRN)を提案する。深層ニューラルネットワークの圧縮を実現しつつ性能を維持する。TT分解を用いたTRNは、32層のResNetに対して54倍の圧縮率を達成し、CIFAR-10で0.3%未満の精度低下にとどまる。驚くべきことに、深層ネットワークではグローバル平均プーリング(GAP)がTRNを上回る性能を示すが、限られたデータで学習する浅層ネットワークでは、ドロップアウトを用いたTRNが優れた性能を発揮する。

ABSTRACT

Tensor regression networks achieve high compression rate of neural networks while having slight impact on performances. They do so by imposing low tensor rank structure on the weight matrices of fully connected layers. In recent years, tensor regression networks have been investigated from the perspective of their compressive power, however, the regularization effect of enforcing low-rank tensor structure has not been investigated enough. We study tensor regression networks using various low-rank tensor approximations, aiming to compare the compressive and regularization power of different low-rank constraints. We evaluate the compressive and regularization performances of the proposed model with both deep and shallow convolutional neural networks. The outcome of our experiment suggests the superiority of Global Average Pooling Layer over Tensor Regression Layer when applied to deep convolutional neural network with CIFAR-10 dataset. On the contrary, shallow convolutional neural networks with tensor regression layer and dropout achieved lower test error than both Global Average Pooling and fully-connected layer with dropout function when trained with a small number of samples.

研究の動機と目的

  • 低ランクテンソル近似がニューラルネットワークに与える正則化および圧縮の効果を調査すること。
  • CP、Tucker、テンソルトレイン(TT)分解を用いたテンソル回帰層(TRL)の性能を比較すること。
  • 浅い畳み込みニューラルネットワーク(CNN)を用いた低データ環境下でのTRLの正則化効果を評価すること。
  • TRLが圧縮および一般化性能において、標準的な層(グローバル平均プーリング(GAP)や全結合層)を上回る可能性があるかを検証すること。
  • テンソルランクパラメータがTRLベースのモデルの表現力および性能に与える影響を分析すること。

提案手法

  • 畳み込みニューラルネットワーク(CNN)の最終全結合層およびフラットテーリング処理を、重みテンソルに低ランク構造を強制するテンソル回帰層(TRL)に置き換える。
  • 重みテンソルをパラメータ化するために、3つの低ランクテンソル分解形式(CP、Tucker、テンソルトレイン(TT))を適用する。
  • テンソル代数および多次元回帰の原則を用いて、各TRLバージョンの学習手順を導出する。
  • 正則化効果を評価するために、エアリー・ストッピング、ドロップアウト(レート0.3、0.5、0.7)、L2正則化(係数0.01、0.001、0.0001)を用いる。
  • MNISTには2つの畳み込み層、CIFAR-10およびSVHNには3つの畳み込み層を備えた標準的なCNNアーキテクチャを用い、最後の畳み込み層の後にドロップアウトを適用する。
  • 訓練データサイズを100〜15,000サンプルに変化させることで、データが限られた状況下での汎化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1CP、Tucker、TTといった異なる低ランクテンソル近似形式は、モデル圧縮および汎化性能においてどのように比較されるか?
  • RQ2全結合層に低ランクテンソル構造を強制することは、低データ環境下で効果的な正則化手段となるか?
  • RQ3深層および浅層ネットワークにおいて、TRLの性能はグローバル平均プーリング(GAP)やドロップアウト付き全結合層と比べてどうか?
  • RQ4テンソルランクパラメータがTRLベースのモデルの表現力および性能に与える影響は何か?
  • RQ5CIFAR-10やMNISTといった標準ベンチマークで、TRLは顕著な精度低下を伴わずに高い圧縮率を達成できるか?

主な発見

  • TRLにおけるテンソルトレイン(TT)分解は、32層のResNetに対して54倍の圧縮率を達成し、CIFAR-10で0.3%未満の精度低下にとどまった。
  • 深層ネットワークではグローバル平均プーリング(GAP)がTRNを上回り、TTまたはTucker分解を用いたTRNよりも高い精度と圧縮性能を示した。
  • 限られたデータ(例:100〜2,000サンプル)で学習する浅いCNNでは、ドロップアウトを用いたTRLがGAPおよびドロップアウト付き全結合層よりも低いテスト誤差を達成した。
  • TuckerおよびTT-TRLにドロップアウトを適用した場合、ドロップアウト付き全結合層よりも高いテスト精度を示した。これは、強い正則化効果を示している。
  • CP、Tucker、TT分解を用いたTRLの性能は、MNISTおよびCIFAR-10において同等であり、形式の違いによる顕著な精度差は観察されなかった。
  • GAPが特定のランク制約下でのTucker分解を用いたTRLの特殊ケースであることが示され、理論的根拠としての同等性が明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。