[论文解读] Rethinking Full Connectivity in Recurrent Neural Networks
本文提出结构稀疏的循环神经网络——具体为DiagonalRNN与BandRNN——通过使用局部连接或自连接来替代RNN中的全连接结构。通过将循环权重矩阵简化为稀疏且适合硬件的结构,该方法在语言建模、语音识别和视频动作识别任务中实现了内存与计算量降低数个数量级,同时保持了具有竞争力的性能。
Recurrent neural networks (RNNs) are omnipresent in sequence modeling tasks. Practical models usually consist of several layers of hundreds or thousands of neurons which are fully connected. This places a heavy computational and memory burden on hardware, restricting adoption in practical low-cost and low-power devices. Compared to fully convolutional models, the costly sequential operation of RNNs severely hinders performance on parallel hardware. This paper challenges the convention of full connectivity in RNNs. We study structurally sparse RNNs, showing that they are well suited for acceleration on parallel hardware, with a greatly reduced cost of the recurrent operations as well as orders of magnitude less recurrent weights. Extensive experiments on challenging tasks ranging from language modeling and speech recognition to video action recognition reveal that structurally sparse RNNs achieve competitive performance as compared to fully-connected networks. This allows for using large sparse RNNs for a wide range of real-world tasks that previously were too costly with fully connected networks.
研究动机与目标
- 解决全连接RNN在低功耗和低成本设备中计算与内存开销过高的问题。
- 克服现代硬件上RNN固有的顺序瓶颈,从而限制并行化处理的问题。
- 探究结构稀疏RNN是否能在大幅减少参数量与推理成本的同时,达到或超越全连接RNN的性能表现。
- 研究用稀疏、局部化或自连接替代密集循环连接所带来的架构与硬件影响。
- 通过利用结构稀疏性,在固定硬件预算下实现更大规模的网络结构,同时不损失模型容量。
提出的方法
- 提出DiagonalRNN,其中每个神经元仅通过对角线循环权重矩阵与自身连接,将循环计算量从O(n²)降低至O(n)。
- 提出BandRNN,一种局部连接变体,其中每个神经元仅与自身及固定数量的邻近神经元(C)连接,形成带状权重矩阵。
- 采用结构化稀疏性(而非非结构化剪枝),以确保适合GPU与TPU加速的规则内存访问模式。
- 在标准基准数据集上训练并评估稀疏RNN,包括语言建模(LibriTTS)、语音识别(VCTK)和视频动作识别(UCF101)。
- 与全连接GRU和LSTM对比性能与效率,测量测试CER、准确率及循环参数数量。
- 将稀疏RNN与现有架构(如PreRNN)结合,评估其在端到端模型中的兼容性与性能增益。
实验结果
研究问题
- RQ1具有局部连接或自连接的结构稀疏RNN是否能在序列建模任务中实现与全连接RNN相当的性能?
- RQ2结构稀疏性在多大程度上能减少循环参数数量与计算成本,同时保持模型准确率?
- RQ3在固定硬件预算下,稀疏RNN的性能随网络规模增大时,相较于全连接模型如何扩展?
- RQ4稀疏RNN是否能在相同内存与计算约束下支持更大规模的网络架构,从而带来性能提升?
- RQ5与非结构化稀疏性或密集RNN相比,使用结构化稀疏性是否能实现更好的硬件并行化与加速效果?
主要发现
- DiagonalRNN与BandRNN在LibriTTS与VCTK任务上达到与全连接GRU相当的性能,测试CER分别为8.57%与9.69%,同时将循环权重减少高达100倍。
- 在UCF101视频动作识别任务中,DiagonalRNN与BandRNN分别达到92.5%–93.5%的准确率,循环权重仅需2.19×10⁵至4.98×10⁶,相比完整PreRNN减少高达100倍。
- 在相同参数预算下,更大的稀疏网络(如DiagonalGRU中1100个单元)优于更小的全连接模型(如Full GRU中768个单元)。
- 结构化稀疏性的使用实现了高效的并行化,消除了密集RNN固有的顺序瓶颈,提升了硬件利用率。
- 当C=201时,BandRNN在UCF101上达到93.2%的准确率,仅需4.98×10⁶个循环权重,性能与完整PreRNN相当,但循环参数减少约80%。
- DiagonalRNN与PreRNN-SIH结合后,在仅使用2.19×10⁵个循环权重的情况下达到92.6%的准确率,相比完整PreRNN减少超过100倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。