Skip to main content
QUICK REVIEW

[论文解读] Generalized Tensor Models for Recurrent Neural Networks

Valentin Khrulkov, Oleksii Hrinchuk|arXiv (Cornell University)|Jan 30, 2019
Tensor decomposition and applications被引用 6
一句话总结

本文提出了用于具有ReLU非线性的循环神经网络(RNNs)的广义张量模型,将深度效率和普遍性的理论分析扩展至乘法型RNN之外。研究证明,基于ReLU的RNN表现出深度效率——需要指数级更宽的浅层网络才能匹配其表达能力,该结论在图像和文本任务上的大量实验中得到验证。

ABSTRACT

Recurrent Neural Networks (RNNs) are very successful at solving challenging problems with sequential data. However, this observed efficiency is not yet entirely explained by theory. It is known that a certain class of multiplicative RNNs enjoys the property of depth efficiency --- a shallow network of exponentially large width is necessary to realize the same score function as computed by such an RNN. Such networks, however, are not very often applied to real life tasks. In this work, we attempt to reduce the gap between theory and practice by extending the theoretical analysis to RNNs which employ various nonlinearities, such as Rectified Linear Unit (ReLU), and show that they also benefit from properties of universality and depth efficiency. Our theoretical results are verified by a series of extensive computational experiments.

研究动机与目标

  • 通过将分析扩展至ReLU非线性,弥合理论深度效率与RNN实际应用之间的差距。
  • 探究基于ReLU的RNN是否保持了在乘法型RNN中观察到的表达能力与深度效率。
  • 利用广义张量分解构建理论框架,以分析非乘法型RNN架构。
  • 通过在视觉与自然语言处理数据集上的实证实验,验证理论推导出的性质。
  • 探讨RNN中共享权重对普遍性与深度效率的影响。

提出的方法

  • 提出广义张量模型,将张量列车(TT)分解扩展至具有ReLU非线性的RNN。
  • 利用广义张量分解将RNN的得分函数表示为网格张量,从而支持理论分析。
  • 应用代数几何与张量秩理论中的工具,证明基于ReLU的RNN具有普遍性与深度效率。
  • 通过估计等效浅层网络的秩下界,量化深度效率。
  • 在MNIST、CIFAR-10与IMDB数据集上进行数值实验,比较性能与秩需求。
  • 在RNN中使用共享核心约束以建模真实世界序列处理,同时分析其对表达能力的影响。

实验结果

研究问题

  • RQ1ReLU非线性是否能在RNN中保持乘法型RNN中观察到的深度效率?
  • RQ2即使在权重共享的情况下,基于ReLU的RNN是否仍保持函数逼近的普遍性?
  • RQ3与基于ReLU的RNN等价的浅层网络的秩是多少?其随序列长度与隐藏维度如何变化?
  • RQ4广义张量模型在情感分析与图像分类等实际任务中,与标准RNN和浅层网络相比表现如何?
  • RQ5当RNN使用共享权重时,理论上的深度效率与普遍性特性在多大程度上仍然成立?

主要发现

  • 基于ReLU的RNN表现出深度效率:与秩为R的ReLU RNN等价的浅层网络,需指数级更大的宽度才能匹配其表达能力。
  • 理论分析确认ReLU RNN是通用逼近器,能够表示一类丰富的函数。
  • 数值实验表明,广义浅层网络在IMDB情感分析任务中实现相当性能所需参数显著多于广义RNN。
  • 对于TT-秩R=1,2,4,8的RNN,等价浅层网络的秩下界通常为1,表明在低秩情况下存在实现紧凑浅层网络的潜力。
  • 然而,当R增大时(例如R=10²–10³),等价浅层网络所需的秩呈指数级增长,证实了在实际场景中的深度效率。
  • 当T与R较大时,等价浅层网络实现多项式大小CP-秩的概率变得可忽略,支持了理论深度效率的结论。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。