Skip to main content
QUICK REVIEW

[论文解读] A Hardware-Efficient ADMM-Based SVM Training Algorithm for Edge Computing

Shuo-An Huang, Chia‐Hsiang Yang|arXiv (Cornell University)|Jul 23, 2019
Sparse and Compressive Sensing Techniques参考文献 25被引用 6
一句话总结

该论文提出了一种基于ADMM的SVM训练算法,结合Nyström方法的低秩近似,以降低计算和内存开销,实现硬件高效化。通过引入预计算、内存共享以及共享EVD硬件,该设计将计算复杂度降低62%,内存使用减少60%,在实时癫痫发作检测芯片中实现了比CPU高153,310倍的能效。

ABSTRACT

This work demonstrates a hardware-efficient support vector machine (SVM) training algorithm via the alternative direction method of multipliers (ADMM) optimizer. Low-rank approximation is exploited to reduce the dimension of the kernel matrix by employing the Nyström method. Verified in four datasets, the proposed ADMM-based training algorithm with rank approximation reduces 32$ imes$ of matrix dimension with only 2% drop in inference accuracy. Compared to the conventional sequential minimal optimization (SMO) algorithm, the ADMM-based training algorithm is able to achieve a 9.8$ imes$10$^7$ shorter latency for training 2048 samples. Hardware design techniques, including pre-computation and memory sharing, are proposed to reduce the computational complexity by 62% and the memory usage by 60%. As a proof of concept, an epileptic seizure detector chip is designed to demonstrate the effectiveness of the proposed hardware-efficient training algorithm. The chip achieves a 153,310$ imes$ higher energy efficiency and a 364$ imes$ higher throughput-to-area ratio for SVM training than a high-end CPU. This work provides a promising solution for edge devices which require low-power and real-time training.

研究动机与目标

  • 解决边缘设备在线SVM训练中计算复杂度高和内存占用大的挑战。
  • 实现在片上实时、低功耗的SVM模型自适应,以克服预训练模型在动态环境中的局限性。
  • 开发一种硬件映射策略,在保持高推理精度的同时最小化硅片面积和能耗。
  • 通过硅验证的癫痫发作检测芯片,证明片上SVM训练的可行性。
  • 通过算法-硬件协同设计技术,显著降低计算复杂度和内存使用。

提出的方法

  • 采用交替方向乘子法(ADMM)将SVM训练问题重构为依赖性更低的可分解优化结构,支持硬件并行处理。
  • 应用Nyström方法对核矩阵进行低秩近似,将矩阵维度从256×256降低至16×16,使计算复杂度降低97%,内存使用减少87%。
  • 引入逆矩阵的预计算以及中间变量(如Z、θ)的复用,分别使计算复杂度降低22%和51%。
  • 在Nyström方法与ADMM更新阶段的线性系统求解中共享特征值分解(EVD)硬件单元,使硅片面积减少37%。
  • 通过共享内存库和寄存器文件实现基于Systolic CORDIC的处理单元阵列,利用中间变量的时间复用,使内存使用减少60%。
  • 采用近似雅可比法进行EVD,通过单周期旋转,相比传统循环雅可比法实现8.9倍加速,延迟降低98.6%。

实验结果

研究问题

  • RQ1基于ADMM的SVM训练能否实现足够高的硬件效率,以支持边缘设备上的实时片上部署?
  • RQ2通过Nyström方法进行低秩近似,能在多大程度上减少非线性SVM训练的计算和内存开销?
  • RQ3预计算和公共项复用在降低迭代ADMM更新的计算复杂度方面有多高效?
  • RQ4在多个阶段(Nyström与线性求解)中共享EVD硬件,是否能显著降低面积和功耗?
  • RQ5将基于ADMM的SVM训练算法映射到定制ASIC时,能在能效和吞吐量-面积比方面实现多大性能提升?

主要发现

  • 所提出的结合Nyström低秩近似的ADMM-SVM训练算法,将核矩阵维度从256×256降低至16×16,实现计算复杂度降低97%、内存存储减少87%。
  • 通过预计算和公共项合并,硬件设计使计算复杂度降低62%;通过中间变量的内存共享,内存使用减少60%。
  • 共享EVD硬件使硅片面积减少37%,同时服务于Nyström近似与ADMM更新阶段的线性系统求解。
  • 近似雅可比法使EVD收敛速度提升8.9倍,相比传统循环雅可比法,处理延迟降低98.6%。
  • 实现的癫痫发作检测芯片在仅2.9 mW功耗下,0.78秒内完成SVM训练,相比Intel i7-2600 CPU,能效提升153,310倍,吞吐量-面积比提高364倍。
  • 尽管进行了秩降维,模型仍保持高推理精度,在四个基准数据集上,当矩阵维度降低32倍时,准确率仅下降2%。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。