Skip to main content
QUICK REVIEW

[论文解读] Compressing Recurrent Neural Networks with Tensor Ring for Action Recognition

Yu Pan, Jing Xu|arXiv (Cornell University)|Nov 19, 2018
Human Pose and Action Recognition被引用 13
一句话总结

该论文提出TR-LSTM,一种紧凑的长短期记忆网络,通过张量环分解(TRD)压缩循环神经网络中的输入到隐藏层的权重矩阵,显著减少参数量的同时保持高精度。该方法在UCF11数据集上实现了超过34,000的压缩比,并在端到端训练下优于标准LSTM、TT-LSTM和BT-LSTM,在动作识别任务中表现优异。

ABSTRACT

Recurrent Neural Networks (RNNs) and their variants, such as Long-Short Term Memory (LSTM) networks, and Gated Recurrent Unit (GRU) networks, have achieved promising performance in sequential data modeling. The hidden layers in RNNs can be regarded as the memory units, which are helpful in storing information in sequential contexts. However, when dealing with high dimensional input data, such as video and text, the input-to-hidden linear transformation in RNNs brings high memory usage and huge computational cost. This makes the training of RNNs unscalable and difficult. To address this challenge, we propose a novel compact LSTM model, named as TR-LSTM, by utilizing the low-rank tensor ring decomposition (TRD) to reformulate the input-to-hidden transformation. Compared with other tensor decomposition methods, TR-LSTM is more stable. In addition, TR-LSTM can complete an end-to-end training and also provide a fundamental building block for RNNs in handling large input data. Experiments on real-world action recognition datasets have demonstrated the promising performance of the proposed TR-LSTM compared with the tensor train LSTM and other state-of-the-art competitors.

研究动机与目标

  • 为解决在处理高维视频数据时,RNN中输入到隐藏层变换带来的高参数量和高计算成本问题。
  • 克服张量列车分解(TTD)的局限性,如严格的秩约束和对核心顺序的敏感性。
  • 开发一种稳定且低秩的RNN架构,在大幅减少模型规模的同时保持性能。
  • 通过可微的张量环层作为即插即用的构建模块,实现压缩RNN的端到端训练。
  • 在真实世界动作识别基准上,与最先进低秩RNN方法相比,展示出更优的压缩能力和精度。

提出的方法

  • 将标准LSTM中的输入到隐藏层权重矩阵重塑为高阶张量,并通过张量环分解(TRD)进行因子分解。
  • TRD将权重张量分解为一系列低秩核心张量构成的环形链,实现高效的参数共享并建模参数间的相关性。
  • TR层具有可微性,可无缝集成到LSTM计算图中,支持端到端反向传播。
  • 通过在首个和最后一个核心张量之间引入环形连接,缓解了张量列车分解的严格秩约束。
  • 在视频动作识别数据集上进行端到端训练,超参数如TR秩经过优化以兼顾性能与压缩率。
  • 该方法具有通用性,可应用于普通RNN和GRUs,不仅限于LSTM。

实验结果

研究问题

  • RQ1张量环分解能否在保持模型性能的前提下,有效压缩RNN中的输入到隐藏层权重矩阵?
  • RQ2在动作识别任务中,TR-LSTM与TT-LSTM和BT-LSTM相比,在压缩比和精度方面表现如何?
  • RQ3TR-LSTM模型在极端参数压缩下是否仍保持稳定性和泛化能力?
  • RQ4TR层能否在不降低性能的前提下,有效用于RNN的端到端训练?
  • RQ5TR-LSTM架构是否适合作为现有基于LSTM的视频理解模型中的即插即用模块?

主要发现

  • 在UCF11数据集上,TR-LSTM相比标准LSTM实现了超过34,000的压缩比,显著优于TT-LSTM和BT-LSTM。
  • 在UCF11上,TR-LSTM在端到端训练中达到86.9%的准确率,超过标准LSTM(68.1%)、TT-LSTM(80.3%)和BT-LSTM(85.6%)。
  • 当使用InceptionV3提取的特征作为输入时,TR-LSTM仅用0.7M参数即达到63.8%的准确率,而I3D模型需25M参数,且表现更优。
  • 由于TRD环形核心结构的鲁棒性,TR-LSTM模型在极端压缩下仍保持高度稳定性和泛化能力。
  • TR层展现出强大的表达能力和灵活性,尽管参数量更低,但性能仍优于TT-LSTM。
  • 该方法具有可扩展性,可作为基础构建模块集成到高级RNN架构(如双流LSTM)中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。