Skip to main content
QUICK REVIEW

[論文レビュー] Deep convolutional tensor network

Philip Blagoveschensky, Anh Huy Phan|arXiv (Cornell University)|May 29, 2020
Quantum many-body systems参考文献 24被引用数 7
ひとこと要約

本稿では、エンタングルド・プレアケット状態(EPS)を組み合わせることで、バックプロパゲーション可能なアーキテクチャとして構築された、パラメータ共有、局所性、深さ——成功した深層ニューラルネットワークの3つの主要な特徴——を統合する新しいテンソルネットワークベースのモデル、Deep Convolutional Tensor Network(DCTN)を提案する。DCTNは、MNISTおよびFashionMNISTで最小限のパラメータで優れた性能を発揮するが、深さに関係なくCIFAR10で深刻な過学習を示すため、複雑なビジョンタスクへのテンソル回帰モデルのスケーリングには根本的な課題があると考えられる。

ABSTRACT

Neural networks have achieved state of the art results in many areas, supposedly due to parameter sharing, locality, and depth. Tensor networks (TNs) are linear algebraic representations of quantum many-body states based on their entanglement structure. TNs have found use in machine learning. We devise a novel TN based model called Deep convolutional tensor network (DCTN) for image classification, which has parameter sharing, locality, and depth. It is based on the Entangled plaquette states (EPS) TN. We show how EPS can be implemented as a backpropagatable layer. We test DCTN on MNIST, FashionMNIST, and CIFAR10 datasets. A shallow DCTN performs well on MNIST and FashionMNIST and has a small parameter count. Unfortunately, depth increases overfitting and thus decreases test accuracy. Also, DCTN of any depth performs badly on CIFAR10 due to overfitting. It is to be determined why. We discuss how the hyperparameters of DCTN affect its training and overfitting.

研究の動機と目的

  • 成功した深層ニューラルネットワークの3つの主要要因であるパラメータ共有、局所性、深さを併せ持つテンソルネットワークモデルを開発すること。
  • エンタングルド・プレアケット状態(EPS)を、誤差逆伝播が可能な形で実装し、微分可能な機械学習パイプラインで利用可能にする。
  • 得られたDeep Convolutional Tensor Network(DCTN)の性能を、標準的な画像分類ベンチマーク(特にMNIST、FashionMNIST、CIFAR10)で評価すること。
  • DCTNにおける一般化性能の悪化、特にCIFAR10のような高複雑度データセットでの過学習の原因を調査すること。
  • 初期化、学習率、入力前処理などのハイパーパrameterが最適化および一般化に与える影響を分析すること。

提案手法

  • モデルは、深層畳み込みニューラルネットワーク(CNN)が示す階層的特徴抽出を模倣するように、複数のエンタングルド・プレアケット状態(EPS)を組み合わせて深層アーキテクチャを構築する。
  • EPSレイヤーはテンソル結合を用いて微分可能関数として実装され、ネットワーク全体にエンドツーエンドのバックプロパゲーションが可能になる。
  • 入力データは、ハイパーパramータ ν を含むスケーリング関数によって前処理され、活性化の大きさに影響を与え、最適化の安定性に寄与する。
  • ネットワークは学習可能な重み行列 A とバイアスベクトル b を使用し、訓練の安定性を高めるために特定の分布で初期化される。
  • 訓練には、学習率スケジューリングとL2正則化(λ)を伴う確率的勾配降下法(SGD)を用いる。
  • 深さは、各レイヤーに設定可能なカーネルサイズ K と量子次元 Q を持つ複数の EPS レイヤーをスタックすることで増加される。

実験結果

リサーチクエスチョン

  • RQ1テンソルネットワークモデルが、成功した深層ニューラルネットワークの3つの主要特徴——パラメータ共有、局所性、深さ——を同時に達成できるか。
  • RQ2エンタングルド・プレアケット状態(EPS)を、深層学習フレームワーク内での微分可能かつバックプロパゲーション可能なレイヤーとして実装する方法は何か。
  • RQ3DCTNの深さを増すと、通常は性能が向上するはずのMNISTおよびFashionMNISTで、なぜテスト精度が悪化するのか。
  • RQ4DCTNは、学習精度が100%に近づくにもかかわらず、CIFAR10であらゆる深さの設定において性能が著しく低いのはなぜか。
  • RQ5学習率、初期化手法、入力前処理(ν)などのハイパーパrameterが、DCTNの訓練ダイナミクスおよび一般化に与える影響は何か。

主な発見

  • 1つのEPSを備えた浅いDCTNは、わずか29万パラメータでMNISTで89.38%の精度を達成し、単純なビジョンタスクにおける高い効率性と性能を示した。
  • 2番目のEPSを追加するとテスト精度は87.65%に低下し、現在のDCTNの設定において、深さの増加が過学習を悪化させることを示した。
  • 3層のDCTNはMNISTで75.94%の精度にとどまり、このアーキテクチャにおいて深さが一般化性能を低下させることをさらに確認した。
  • CIFAR10では、最良のDCTNモデル(例:グレースケールで54.8%)ですら、ランダムチョイスよりわずかに優れているにとどまり、どの深さ設定でも競争力のある結果を得られなかった。
  • CIFAR10では、学習精度がほぼ100%に達しているため、過学習が主な失敗モードであり、最適化の困難さによるものではないことが示された。
  • ハイパーパラメータチューニング——特に入力前処理におけるνの低減と初期化の調整——が一般化に顕著な影響を与え、DCTNの性能には慎重なハイパーパラメータ選定が不可欠であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。