Skip to main content
QUICK REVIEW

[论文解读] Compressing Recurrent Neural Networks Using Hierarchical Tucker Tensor Decomposition

Miao Yin, Siyu Liao|arXiv (Cornell University)|May 9, 2020
Tensor decomposition and applications参考文献 20被引用 21
一句话总结

该论文提出分层 Tucker(HT)张量分解以压缩循环神经网络(RNNs),实现更强的层次表征学习并取得更优的模型压缩效果。HT-LSTM 在多个基准测试中实现了高达 12,945× 的压缩比,并在 YouTube Faces 数据集上达到 88.1% 的测试准确率,在 UCF11 数据集上达到 98.1% 的准确率,显著优于 TT-LSTM、TR-LSTM 和 BT-LSTM 等当前最先进方法。

ABSTRACT

Recurrent Neural Networks (RNNs) have been widely used in sequence analysis and modeling. However, when processing high-dimensional data, RNNs typically require very large model sizes, thereby bringing a series of deployment challenges. Although the state-of-the-art tensor decomposition approaches can provide good model compression performance, these existing methods are still suffering some inherent limitations, such as restricted representation capability and insufficient model complexity reduction. To overcome these limitations, in this paper we propose to develop compact RNN models using Hierarchical Tucker (HT) decomposition. HT decomposition brings strong hierarchical structure to the decomposed RNN models, which is very useful and important for enhancing the representation capability. Meanwhile, HT decomposition provides higher storage and computational cost reduction than the existing tensor decomposition approaches for RNN compression. Our experimental results show that, compared with the state-of-the-art compressed RNN models, such as TT-LSTM, TR-LSTM and BT-LSTM, our proposed HT-based LSTM (HT-LSTM), consistently achieves simultaneous and significant increases in both compression ratio and test accuracy on different datasets.

研究动机与目标

  • 解决现有张量分解方法(如 TT、TR、BT)在 RNN 压缩中因层次结构较弱而导致的表征能力受限问题。
  • 通过引入一种支持更强层次建模并实现更大参数与计算量节省的分解方法,克服先前方法在模型复杂度降低方面的不足。
  • 利用分层 Tucker(HT)分解开发一种紧凑的 RNN 架构,增强表征能力的同时最小化存储与计算成本。
  • 证明基于 HT 的 RNN 能在多种序列建模任务中实现高于当前最先进压缩 RNN 模型的准确率与压缩比。
  • 在多个视频与文本数据集上,验证 HT 分解在端到端训练与预训练 CNN 微调设置下的有效性。

提出的方法

  • 将分层 Tucker(HT)分解应用于 LSTM 网络的权重矩阵,特别是输入到隐藏层与输出到隐藏层的权重张量。
  • 将原始高维权重张量表示为核心张量与一组因子矩阵的组合,形成捕捉多层级依赖关系的层次结构。
  • 采用多级张量分解框架,递归地在每一层分解中降低权重张量的秩与维度。
  • 使用标准反向传播与 ADAM 优化器训练 HT-LSTM 模型,并引入 L2 正则化与 Dropout 以提升泛化能力。
  • 在预训练 CNN 设置下,使用 Inception-V3 提取紧凑特征(2,048 维),将其重塑为 4D 张量(如 8×8×8×4),并对 RNN 的权重矩阵应用 HT 分解。
  • 在所有实验中将所有 HT 分解节点的秩设为 4,以确保与先前工作的可比性。

实验结果

研究问题

  • RQ1分层 Tucker 分解在压缩 RNN 中是否能提供优于现有张量分解方法(如 TT、TR、BT)的表征能力?
  • RQ2与当前最先进方法相比,基于 HT 的 RNN 压缩是否能在保持或提升测试准确率的同时实现更高的模型压缩比?
  • RQ3在标准视频与文本序列基准测试中,HT-LSTM 与 TT-LSTM、TR-LSTM 和 BT-LSTM 的性能表现如何?
  • RQ4当与预训练 CNN 作为特征提取器结合使用时,HT-LSTM 是否能在低资源环境下保持高性能?
  • RQ5HT 分解的层次结构在多大程度上增强了 RNN 对序列依赖关系的建模能力?

主要发现

  • 在 YouTube Faces 数据集上,HT-LSTM 达到 88.1% 的测试准确率,较之前最先进模型(80.8%)高出 7.3 个百分点。
  • 在 UCF11 数据集上,HT-LSTM 达到 98.1% 的准确率——比最佳先前结果(94.6%)高出 3.5 个百分点,且比使用相同预训练 CNN 的 TR-LSTM 高出 4.3 个百分点。
  • 在 UCF11 上,HT-LSTM 实现了 12,945× 的压缩比,远超 TR-LSTM 在压缩相同原始 LSTM 时的 25× 压缩比。
  • 在 HMDB51 数据集上,HT-LSTM 达到 64.2% 的准确率,优于 TR-LSTM(63.8%),且在未使用光流数据的情况下也超越了大多数先前方法。
  • HT-LSTM 仅使用 RGB 输入即实现 64.2% 的准确率,而先前最先进模型仅使用 RGB 时准确率为 49.8%,表明其具备更强的鲁棒性与效率。
  • HT 分解的层次结构使模型能更好地捕捉复杂序列模式,从而在泛化能力与表征能力方面优于非层次化方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。