[论文解读] X-TIME: An in-memory engine for accelerating machine learning on tabular data with CAMs
X-TIME 提出了一种新颖的内存内计算架构,采用高精度模拟内容可寻址存储器(aCAMs),以加速基于树的机器学习模型(如 XGBoost 和 CatBoost)的推理。通过将决策树直接映射到模拟 CAM 阵列中,实现对特征值与存储决策范围的并行、原位比较,X-TIME 在 19W 功耗下实现比 V100 GPU 低 9740 倍的延迟和 119 倍的吞吐量,并通过集成平均方法对硬件变化保持鲁棒性。
Structured, or tabular, data is the most common format in data science. While deep learning models have proven formidable in learning from unstructured data such as images or speech, they are less accurate than simpler approaches when learning from tabular data. In contrast, modern tree-based Machine Learning (ML) models shine in extracting relevant information from structured data. An essential requirement in data science is to reduce model inference latency in cases where, for example, models are used in a closed loop with simulation to accelerate scientific discovery. However, the hardware acceleration community has mostly focused on deep neural networks and largely ignored other forms of machine learning. Previous work has described the use of an analog content addressable memory (CAM) component for efficiently mapping random forests. In this work, we develop an analog-digital architecture that implements a novel increased precision analog CAM and a programmable chip for inference of state-of-the-art tree-based ML models, such as XGBoost, CatBoost, and others. Thanks to hardware-aware training, X-TIME reaches state-of-the-art accuracy and 119x higher throughput at 9740x lower latency with >150x improved energy efficiency compared with a state-of-the-art GPU for models with up to 4096 trees and depth of 8, with a 19W peak power consumption.
研究动机与目标
- 解决在表格数据上使用大规模基于树的机器学习模型进行实时应用时对超低延迟推理日益增长的需求。
- 克服 CPU 和 GPU 在处理大规模树集成中不规则内存访问和线程同步时的性能瓶颈。
- 设计一种整体性的内存内架构,集成高精度模拟 CAM 与可重构片上网络(NoC),实现可扩展、高能效的推理。
- 在单枚芯片上支持多种基于树的模型(如回归、多分类)和推理技术(如输入批处理)。
- 通过架构级韧性与误差缓解机制,确保对硬件变化(如忆阻器电导漂移和 DAC 输入误差)的鲁棒性。
提出的方法
- 通过将决策阈值编码为存储在忆阻器基 CAM 单元中的模拟范围,将决策树映射到模拟 CAM 阵列中。
- 实现一种新型 8 位精度模拟 CAM 单元设计,相比先前的 4 位设计,显著提升了分辨率与精度。
- 在核心内使用 SRAM 存储叶值,并在单个核心内对多个树进行本地累加。
- 采用可重构的 H 树片上网络(NoC)连接 4096 个核心,实现可扩展的数据流与模型映射。
- 集成网络内归约逻辑,通过在 NoC 中传播数据时累加叶输出,最大限度减少数据移动。
- 应用缺陷感知设计原则,利用 TaOx 忆阻器和 16nm 模拟电路的实验数据,对硬件变化导致的精度退化进行建模与缓解。
实验结果
研究问题
- RQ1与先前的 4 位设计相比,采用更高精度(8 位)的模拟 CAM 是否能显著提升基于树的机器学习推理的精度与性能?
- RQ2模拟内存计算与可重构 NoC 的集成如何实现对多样化基于树模型拓扑结构的可扩展、低延迟推理?
- RQ3所提出的架构在多大程度上对真实世界硬件缺陷(如忆阻器电导变化和 DAC 输入误差)具有鲁棒性?
- RQ4与最先进的 GPU 和 FPGA 加速器相比,该架构在大规模树集成(如 100 万个节点以上)中可实现多大的延迟与吞吐量提升?
- RQ5该架构能否在支持复杂模型与多样化推理工作负载的同时,保持高能效(如低每决策能量)?
主要发现
- X-TIME 在 Churn 建模数据集上实现比 NVIDIA V100 GPU 低 9740 倍的推理延迟和 119 倍的吞吐量,延迟低至约 100 ns。
- 该架构的延迟与吞吐量保持恒定,不随树的数量或叶节点数变化,仅取决于特征数量与类别数,而 GPU 和 FPGA 的性能则随模型规模线性变化。
- 系统峰值功耗仅为 19W,实现每决策 0.3 nJ 的超低能耗,显著优于 GPU 和基于 SRAM 的加速器。
- 模型对硬件缺陷具有鲁棒性:忆阻器翻转概率为 0.2% 时,精度下降不足 0.5%,得益于基于树模型的集成特性。
- 8 位模拟 CAM 设计相比先前工作将精度提升一倍,实现更高精度,同时不牺牲面积或能效效率。
- 可重构 NoC 与网络内归约机制可高效支持多样化工作负载,包括输入批处理与多分类任务,且数据移动极少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。