[论文解读] Toward Computation and Memory Efficient Neural Network Acoustic Models with Binary Weights and Activations
本文提出通过使用二值权重和激活值来训练深度神经网络声学模型,以显著减少内存占用并加速计算。通过将实数值权重和激活值替换为{-1, +1}或{0, 1},矩阵乘法被替换为快速的按位运算和加法运算,从而实现在资源受限设备上的高效推理。该方法在WSJ和AMI数据集上取得了具有竞争力的词错误率(WER),其中采用半随机二值化的二值权重模型在AMI数据集上将WER降低了约1%的绝对值。
Neural network acoustic models have significantly advanced state of the art speech recognition over the past few years. However, they are usually computationally expensive due to the large number of matrix-vector multiplications and nonlinearity operations. Neural network models also require significant amounts of memory for inference because of the large model size. For these two reasons, it is challenging to deploy neural network based speech recognizers on resource-constrained platforms such as embedded devices. This paper investigates the use of binary weights and activations for computation and memory efficient neural network acoustic models. Compared to real-valued weight matrices, binary weights require much fewer bits for storage, thereby cutting down the memory footprint. Furthermore, with binary weights or activations, the matrix-vector multiplications are turned into addition and subtraction operations, which are computationally much faster and more energy efficient for hardware platforms. In this paper, we study the applications of binary weights and activations for neural network acoustic modeling, reporting encouraging results on the WSJ and AMI corpora.
研究动机与目标
- 通过减少内存占用和计算成本,实现在资源受限嵌入式设备上的深度神经网络声学模型部署。
- 研究在大规模词汇量语音识别任务中使用二值权重和激活值的神经网络的可行性与性能。
- 开发实用的训练算法,以缓解二值神经网络中常见的训练发散问题。
- 评估不同二值化策略的影响,包括半随机二值化和基于阈值的激活二值化。
- 在语音识别背景下,比较不同激活范围(如(-1, +1)与(0, 1))的性能差异。
提出的方法
- 使用温度控制的Sigmoid函数进行随机近似,对网络权重进行二值化,从而实现通过离散值的反向传播。
- 采用直通估计器对二值激活函数进行梯度反向传播,实现端到端训练。
- 应用带有可学习温度参数p的半随机二值化方法,使训练过程中从实数值权重逐步过渡到二值权重。
- 使用可学习阈值k对激活值进行基于阈值的二值化,并对不同激活范围分别进行优化。
- 采用改进的类似ReLU的激活函数,结合硬Sigmoid近似,以改善训练过程中的梯度流动。
- 对二值模型使用较低的初始学习率(0.001),相较于基线模型(0.008),以稳定优化过程。
实验结果
研究问题
- RQ1二值权重和激活值能否在大规模词汇量语音识别任务中有效应用?
- RQ2带有温度参数p的半随机二值化对模型收敛性和性能有何影响?
- RQ3不同激活范围(如(-1, +1)与(0, 1))对模型准确率和训练稳定性有何影响?
- RQ4基于阈值的激活二值化如何影响识别性能和训练动态?
- RQ5为何同时采用二值权重和二值激活的模型无法收敛,其背后的优化挑战是什么?
主要发现
- 在AMI数据集上,采用p = 0.01的半随机二值化方法,使评估集上的WER相比基线降低了约1%的绝对值。
- 采用p = 0.01的二值权重模型在AMI数据集的开发集上达到29.6%的WER,在评估集上达到31.7%的WER。
- 当k=1时,(0,1)范围的二值激活显著优于(-1,+1)范围,表明其与Sigmoid初始化网络具有更好的兼容性。
- 随着阈值k的增加,(0,1)二值化模型的性能迅速下降,可能是因为负输入的近似误差不对称所致。
- 采用二值权重和二值激活的二值神经网络在隐藏单元数为2048时无法收敛,表明联合二值化存在显著的优化挑战。
- 在WSJ1数据集上,开发集和评估集均未观察到一致的WER改进,可能由于数据分布不匹配,因此无法从该数据集得出强结论。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。