[论文解读] Learning Machines Implemented on Non-Deterministic Hardware
本文提出通过将关键矩阵计算卸载到非确定性、随机性硬件上来加速机器学习工作负载,此类硬件以牺牲精度为代价换取速度和能效。利用数字随机电路近似矩阵乘法,作者证明在该噪声硬件上训练的深度神经网络可达到与精确计算相当或略优的测试准确率,验证了容错硬件-软件协同设计在大规模学习系统中的可行性。
This paper highlights new opportunities for designing large-scale machine learning systems as a consequence of blurring traditional boundaries that have allowed algorithm designers and application-level practitioners to stay -- for the most part -- oblivious to the details of the underlying hardware-level implementations. The hardware/software co-design methodology advocated here hinges on the deployment of compute-intensive machine learning kernels onto compute platforms that trade-off determinism in the computation for improvement in speed and/or energy efficiency. To achieve this, we revisit digital stochastic circuits for approximating matrix computations that are ubiquitous in machine learning algorithms. Theoretical and empirical evaluation is undertaken to assess the impact of the hardware-induced computational noise on algorithm performance. As a proof-of-concept, a stochastic hardware simulator is employed for training deep neural networks for image recognition problems.
研究动机与目标
- 探索使用非确定性、近似硬件加速大规模机器学习工作负载的可行性。
- 应对传统通用处理器在摩尔定律放缓背景下性能与能效差距日益扩大的问题。
- 设计一种硬件-软件协同设计框架,利用机器学习算法固有的噪声鲁棒性。
- 评估随机硬件引入的噪声是否可被利用以在不牺牲准确率的前提下提升或维持学习性能。
- 通过保持编程模型不变并最小化软件开发开销,实现此类加速器的实际部署。
提出的方法
- 作者使用数字随机电路将数值表示为随机比特序列,从而实现对机器学习核心的矩阵乘法的近似计算。
- 他们引入一种高层抽象,用于建模随机计算引入的统计误差,特别是矩阵乘法内核中的误差。
- 该框架将随机硬件加速器集成到训练流水线中,用于执行前向传播和反向传播等计算密集型操作。
- 系统采用批量梯度下降法,并引入可调的随机比特序列长度 N 作为新的超参数,以控制噪声水平。
- 主机处理器负责管理加速器并协调训练过程,而随机硬件在前向和反向传播过程中引入受控噪声。
- 该方法在 MNIST 数据集上的深度神经网络上进行了评估,训练在由 N 定义的不同噪声水平下进行。
实验结果
研究问题
- RQ1非确定性、近似硬件是否可在不降低模型准确率的前提下用于加速机器学习?
- RQ2随机电路引入的硬件计算噪声如何影响基于梯度的学习算法的收敛性和性能?
- RQ3随机计算引入的噪声是否起到正则化作用,从而提升深度神经网络的泛化能力?
- RQ4随机比特序列长度 N 对训练稳定性和最终模型准确率有何影响?
- RQ5在将随机硬件加速器集成到现有机器学习工作流时,编程模型是否可保持不变?
主要发现
- 在 N = 256 的随机硬件上训练的深度神经网络,测试误差率为 1.62%,略优于使用精确计算的对照模型的 1.75%。
- 减少随机比特序列长度 N 导致训练交叉熵误差单调上升,但所有测试的 N 值下测试准确率保持稳定或有所提升。
- 在噪声硬件上训练时分类准确率的提升表明,随机噪声可能起到弱正则化作用,增强泛化能力。
- 通过在随机硬件上使用堆叠稀疏自编码器进行权重预训练的网络,对照模型的测试误差为 1.35%,而随机硬件训练的模型误差更低。
- N 值范围广泛(从 64 到 512)的实验结果与精确计算相比表现相当或更优,表明硬件噪声具有广泛的容错窗口。
- 结果表明,随机硬件可作为可行的加速器使用,且无需更改软件栈或模型架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。