Skip to main content
QUICK REVIEW

[论文解读] Deep convolutional tensor network

Philip Blagoveschensky, Anh Huy Phan|arXiv (Cornell University)|May 29, 2020
Quantum many-body systems参考文献 24被引用 7
一句话总结

本文提出深度卷积张量网络(DCTN),一种基于张量网络的新模型,通过将纠缠斑块态(EPS)组合成可反向传播的架构,整合了成功深度神经网络的关键特性——参数共享、局部性与深度。DCTN 在 MNIST 和 FashionMNIST 上以极少参数实现优异性能,但在 CIFAR10 上无论深度如何均出现严重过拟合,表明在复杂视觉任务中扩展张量回归模型存在根本性挑战。

ABSTRACT

Neural networks have achieved state of the art results in many areas, supposedly due to parameter sharing, locality, and depth. Tensor networks (TNs) are linear algebraic representations of quantum many-body states based on their entanglement structure. TNs have found use in machine learning. We devise a novel TN based model called Deep convolutional tensor network (DCTN) for image classification, which has parameter sharing, locality, and depth. It is based on the Entangled plaquette states (EPS) TN. We show how EPS can be implemented as a backpropagatable layer. We test DCTN on MNIST, FashionMNIST, and CIFAR10 datasets. A shallow DCTN performs well on MNIST and FashionMNIST and has a small parameter count. Unfortunately, depth increases overfitting and thus decreases test accuracy. Also, DCTN of any depth performs badly on CIFAR10 due to overfitting. It is to be determined why. We discuss how the hyperparameters of DCTN affect its training and overfitting.

研究动机与目标

  • 开发一种结合深度神经网络三大成功因素(参数共享、局部性与深度)的张量网络模型。
  • 实现通过纠缠斑块态(EPS)的可微分、可反向传播层,使其适用于可微机器学习流程。
  • 在标准图像分类基准(尤其是 MNIST、FashionMNIST 和 CIFAR10)上评估所提出的深度卷积张量网络(DCTN)的性能。
  • 探究 DCTN 一般化性能差的原因,特别是对高复杂度数据集(如 CIFAR10)的过拟合问题。
  • 分析学习率、初始化方式和输入预处理(ν)等超参数对优化与泛化的影响。

提出的方法

  • 通过将多个纠缠斑块态(EPS)组合成深层架构构建模型,模拟深度卷积神经网络的分层特征学习机制。
  • EPS 层通过张量收缩实现为可微函数,支持网络端到端的反向传播。
  • 输入数据通过包含超参数 ν 的缩放函数进行预处理,该参数影响激活值的大小,进而影响优化稳定性。
  • 网络使用可学习的权重矩阵 A 和偏置向量 b,采用特定分布初始化以稳定训练过程。
  • 训练采用标准优化技术:带有学习率调度和 L2 正则化(λ)的随机梯度下降。
  • 通过堆叠多个 EPS 层增加模型深度,每层支持可配置的卷积核大小 K 和量子维数 Q。

实验结果

研究问题

  • RQ1能否使张量网络模型同时具备深度神经网络三大成功因素:参数共享、局部性与深度?
  • RQ2如何在深度学习框架中实现纠缠斑块态(EPS)作为可微分、可反向传播的层?
  • RQ3为何在 DCTN 中增加深度反而导致 MNIST 和 FashionMNIST 上测试准确率下降,尽管更深网络通常能提升性能?
  • RQ4为何 DCTN 在所有深度设置下均在 CIFAR10 上表现不佳,即使训练准确率接近 100%?
  • RQ5学习率、初始化策略和输入预处理(ν)等超参数如何影响 DCTN 的训练动态与泛化性能?

主要发现

  • 单层 EPS 的浅层 DCTN 在 MNIST 上仅用 290,000 个参数即达到 89.38% 的准确率,表明其在简单视觉任务上具有强大效率与性能。
  • 增加第二层 EPS 后,测试准确率下降至 87.65%,表明当前 DCTN 设置下深度增加会加剧过拟合。
  • 三层 DCTN 在 MNIST 上准确率仅为 75.94%,进一步证实该架构中深度会损害泛化能力。
  • 在 CIFAR10 上,即使表现最佳的 DCTN 模型(如灰度图下 54.8%)性能也仅略高于随机猜测,且无任何深度配置能取得竞争力结果。
  • 模型在 CIFAR10 上几乎达到 100% 的训练准确率,表明过拟合是主要失败模式,而非优化困难。
  • 超参数调优——特别是降低输入预处理中的 ν 值并调整初始化——显著影响泛化性能,表明 DCTN 性能高度依赖于精细的超参数选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。