[论文解读] First-Generation Inference Accelerator Deployment at Facebook
Facebook 与合作伙伴共同设计了一款高性能、高能效的推理加速器系统,采用六张低功耗卡(每张13W)通过 PCIe 互联,功耗为 91W,实现 180–270 TOPS(int8)性能和 96 GB 的 LPDDR 内存。该开放生态系统基于 OCP 硬件和开源软件(PyTorch、Caffe2、Glow),可高效部署大规模机器学习模型——包括复杂的自然语言处理和推荐系统模型——在延迟和吞吐量方面优于 CPU。
In this paper, we provide a deep dive into the deployment of inference accelerators at Facebook. Many of our ML workloads have unique characteristics, such as sparse memory accesses, large model sizes, as well as high compute, memory and network bandwidth requirements. We co-designed a high-performance, energy-efficient inference accelerator platform based on these requirements. We describe the inference accelerator platform ecosystem we developed and deployed at Facebook: both hardware, through Open Compute Platform (OCP), and software framework and tooling, through Pytorch/Caffe2/Glow. A characteristic of this ecosystem from the start is its openness to enable a variety of AI accelerators from different vendors. This platform, with six low-power accelerator cards alongside a single-socket host CPU, allows us to serve models of high complexity that cannot be easily or efficiently run on CPUs. We describe various performance optimizations, at both platform and accelerator level, which enables this platform to serve production traffic at Facebook. We also share deployment challenges, lessons learned during performance optimization, as well as provide guidance for future inference hardware co-design.
研究动机与目标
- 应对 Facebook 数据中心中日益复杂的机器学习模型带来的高算力、低延迟推理需求增长。
- 克服基于 CPU 的推理在大规模模型场景下的局限性,特别是针对稀疏内存访问、大模型尺寸和高带宽需求的挑战。
- 协同设计软硬件栈,支持多样化机器学习工作负载(自然语言处理、计算机视觉、推荐系统),实现高性能与高能效。
- 通过构建开放生态系统,支持多厂商 AI 加速器和框架的可扩展性与互操作性。
- 在模型、卡、算子和系统层级进行优化,以最大化生产环境中的资源利用率并最小化延迟。
提出的方法
- 协同设计六张卡的加速器系统,采用低功耗、高 TOPS/W 的卡片(30–45 TOPS/int8,4–6 TFLOPS/FP16),通过 PCIe 交换机互联,实现性能与内存容量的可扩展。
- 部署针对大规模推荐系统模型的多卡分区策略,实现嵌入表和计算在各卡间的高效分布。
- 在模型层(量化、算子协同设计)、卡层(图划分、批处理、核心布局)和系统层(服务栈修改)实施软件栈优化。
- 利用开源框架(PyTorch、Caffe2、Glow)和工具(ONNXifi)确保可移植性,并支持多种加速器和模型类型。
- 在向量核心中实现可编程性,以支持未来模型压缩技术,如 4 位量化和逐行剪枝。
- 探索未来硬件扩展,如集成视频解码和可编程的存内计算(PIM),以适应未来模型和工作负载的变化。
实验结果
研究问题
- RQ1如何协同设计可扩展、高能效的推理加速器系统,以满足 Facebook 大规模生产级机器学习工作负载的独特需求?
- RQ2在多卡加速器平台上部署复杂模型时,为实现高利用率和低延迟,需要哪些软件与系统级优化?
- RQ3如何构建开放的硬件与软件生态系统,以支持多样化的 AI 加速器和框架之间的互操作性?
- RQ4可编程性在支持不断演进的模型压缩与优化技术(如 4 位量化和逐行剪枝)中发挥何种作用?
- RQ5在加速器系统中集成专用组件(如视频解码器或存内计算,PIM)面临哪些关键挑战与机遇?
主要发现
- 六张卡加速器系统实现 180–270 TOPS(int8)和 24–36 TFLOPS(FP16)性能,配备 96 GB LPDDR 内存,峰值能效达 2.0–3.0 TOPS/W。
- 经软件优化后,系统可高效服务大规模推荐系统模型(最大达当前模型的 300 倍),这些模型因内存与算力限制在 CPU 上无法运行。
- 开放生态系统基于 OCP 硬件和开源软件(PyTorch、Caffe2、Glow、ONNXifi),支持多厂商与多框架,推动更广泛的创新与可移植性。
- 模型层级的优化(如量化和算子协同设计)显著提升性能,并减轻加速器卡上的内存压力。
- 可编程向量核心实现了对新兴压缩技术(如 4 位量化和逐行剪枝)的运行时支持,即使在初始硬件设计完成后仍可扩展。
- 与基于 CPU 的推理相比,该系统在自然语言处理和推荐系统等高复杂度模型上显著提升了吞吐量和降低了延迟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。