[论文解读] Tensor Decomposition for Compressing Recurrent Neural Network
本文提出使用张量分解方法(CP、Tucker 和 Tensor Train,TT)对门控循环单元(GRUs)进行压缩,以减少模型参数量,同时保持性能。在多个序列建模任务中,TT-GRU 在相同参数量下表现最佳,尤其在多音音乐数据集上优于 CP-GRU 和 Tucker-GRU。
In the machine learning fields, Recurrent Neural Network (RNN) has become a popular architecture for sequential data modeling. However, behind the impressive performance, RNNs require a large number of parameters for both training and inference. In this paper, we are trying to reduce the number of parameters and maintain the expressive power from RNN simultaneously. We utilize several tensor decompositions method including CANDECOMP/PARAFAC (CP), Tucker decomposition and Tensor Train (TT) to re-parameterize the Gated Recurrent Unit (GRU) RNN. We evaluate all tensor-based RNNs performance on sequence modeling tasks with a various number of parameters. Based on our experiment results, TT-GRU achieved the best results in a various number of parameters compared to other decomposition methods.
研究动机与目标
- 在不牺牲模型表达能力的前提下,减少循环神经网络(RNNs)的参数数量。
- 评估张量分解方法(CP、Tucker 和 TT)在压缩 RNN 权重矩阵方面的有效性。
- 在不同参数数量下,比较 CP-GRU、Tucker-GRU 和 TT-GRU 在序列建模任务中的性能表现。
- 确定哪种张量分解方法能在实现高效资源受限设备部署的同时,最大程度保持模型准确率。
提出的方法
- 应用 CP 分解将 GRU 单元的权重矩阵分解为若干秩一张量的和。
- 使用 Tucker 分解将权重矩阵表示为核心张量与各模态上因子矩阵的乘积。
- 采用张量列车(TT)分解将权重矩阵表示为一系列以链式连接的低秩张量。
- 利用每种分解方法对 GRU 模型进行重参数化,将密集权重矩阵替换为紧凑的张量格式。
- 使用负对数似然(NLL)作为评估指标,在多音音乐序列建模任务上训练并评估压缩后的模型。
- 通过调整每种分解方法的秩超参数,控制各模型的参数数量。
实验结果
研究问题
- RQ1在保持性能的前提下,CP、Tucker 和 TT 分解在压缩 GRU 模型时表现如何比较?
- RQ2在给定参数数量下,哪种张量分解方法在序列建模任务中取得最低的负对数似然(NLL)得分?
- RQ3TT 分解能否在性能上保持或超越未压缩的 GRU 以及其他分解变体?
- RQ4在参数约束下,模型性能在不同数据集(Nottingham、JSB Chorales、PianoMidi、MuseData)上的表现如何变化?
- RQ5在 RNN 压缩中,每种分解方法在参数效率与性能之间的权衡关系如何?
主要发现
- TT-GRU 在所有数据集上均取得了最低的负对数似然(NLL)得分,在相同参数量下优于 CP-GRU 和 Tucker-GRU。
- 在 PianoMidi 数据集上,TT-GRU 在 11,392 个参数下取得 NLL 7.16,优于 Tucker-GRU(7.20)和 CP-GRU(7.23)的相近参数水平。
- 在 MuseData 数据集上,TT-GRU 在 11,392 个参数下取得 NLL 7.16,而 Tucker-GRU 得分为 7.20,CP-GRU 为 7.23。
- 当参数数量超过 6,000 时,CP-GRU 的性能与 TT-GRU 相当,但在所有测试配置中仍略逊一筹。
- Tucker-GRU 在所有数据集和参数设置下均持续表现弱于 CP-GRU 和 TT-GRU。
- TT 分解在显著减少参数量的同时保持了较高的模型表达能力,因此是本研究中压缩 GRU 的最有效方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。