Skip to main content
QUICK REVIEW

[论文解读] Accelerating Binarized Neural Networks via Bit-Tensor-Cores in Turing GPUs

Ang Li, Simon Su|arXiv (Cornell University)|Jun 30, 2020
Advanced Neural Network Applications参考文献 69被引用 7
一句话总结

本文提出了一种新颖的比特数据格式与优化内核设计,以充分利用NVIDIA Turing GPU的比特-张量核心(BTC)来加速二值化神经网络(BNNs)。通过协同设计数据布局并利用BTC的8×128与128×8分块操作,作者在ImageNet上实现了比现有最先进的基于GPU的BNN快77%的推理性能(ResNet-18模型下达到5.6K张图像/秒),通过硬件感知的软件优化展现出卓越性能。

ABSTRACT

Despite foreseeing tremendous speedups over conventional deep neural networks, the performance advantage of binarized neural networks (BNNs) has merely been showcased on general-purpose processors such as CPUs and GPUs. In fact, due to being unable to leverage bit-level-parallelism with a word-based architecture, GPUs have been criticized for extremely low utilization (1%) when executing BNNs. Consequently, the latest tensorcores in NVIDIA Turing GPUs start to experimentally support bit computation. In this work, we look into this brand new bit computation capability and characterize its unique features. We show that the stride of memory access can significantly affect performance delivery and a data-format co-design is highly desired to support the tensorcores for achieving superior performance than existing software solutions without tensorcores. We realize the tensorcore-accelerated BNN design, particularly the major functions for fully-connect and convolution layers -- bit matrix multiplication and bit convolution. Evaluations on two NVIDIA Turing GPUs show that, with ResNet-18, our BTC-BNN design can process ImageNet at a rate of 5.6K images per second, 77% faster than state-of-the-art. Our BNN approach is released on https://github.com/pnnl/TCBNN.

研究动机与目标

  • 研究并充分利用NVIDIA Turing GPU张量核心的新比特计算能力,以加速二值化神经网络(BNN)的推理。
  • 解决现有BNN实现中因内存访问步长不佳而导致的性能瓶颈问题。
  • 协同设计比特数据格式与BTC硬件,以最大化比特级并行性的利用率,并在性能上超越纯软件实现的BNN方案。
  • 在现代Turing GPU上实现并评估一个完整的BNN推理框架,该框架基于BTC加速的比特矩阵乘法与比特卷积。

提出的方法

  • 设计一种新型比特数据格式(FSB),使其与BTC的8×128和128×8分块大小对齐,以最小化内存访问步长惩罚。
  • 使用CUDA与CUTLASS实现针对BTC硬件单元的优化内核,用于比特矩阵乘法(BMM)与比特卷积(BConv)。
  • 协同设计数据布局与内核调度策略,以在Turing GPU上最大化占用率与内存吞吐量。
  • 使用集合通信原语(NCCL、MPI)将BNN推理扩展至多张GPU,以支持集成方法(如BENN)。
  • 在RTX 2080与RTX 2080 Ti GPU上对六种模型(MLP、VGG类、AlexNet、VGG-16、ResNet-14/18)与三种数据集(MNIST、CIFAR-10、ImageNet)进行框架评估。

实验结果

研究问题

  • RQ1内存访问步长在Turing GPU上对使用比特-张量核心的BNN推理性能有何影响?
  • RQ2为充分挖掘BTC在BNN中比特计算能力,需要何种数据格式与软件优化?
  • RQ3BTC加速的BNN能否实现在ImageNet上的实时推理?与现有最先进的基于GPU的BNN相比表现如何?
  • RQ4在多GPU上扩展BNN推理时性能如何变化?通信开销在集成BNN(如BENN)中扮演何种角色?
  • RQ5通过架构协同设计与模型集成技术(如提升方法)可在多大程度上保持或提升BNN的准确性?

主要发现

  • 所提出的FSB比特数据格式显著降低了内存访问步长惩罚,从而实现了对BTC的8×128与128×8分块操作的高效利用。
  • 在RTX 2080与RTX 2080 Ti GPU上,BTC-BNN框架在ImageNet上使用ResNet-18模型实现了每秒5.6K张图像的推理速度,相比现有最先进的基于GPU的BNN性能提升了77%。
  • 与先前基于GPU的BNN相比,该框架在六种模型与三种数据集上实现了平均2.33倍的延迟加速与1.81倍的吞吐量加速。
  • 在单节点多GPU扩展场景下,通信开销较小;但在多节点扩展场景下,通信开销成为主导因素,表明节点间通信是分布式BNN推理的关键瓶颈。
  • 通过使用BENN等集成方法,可在保持低延迟的同时实现高精度BNN推理(例如,使用ResNet-18在ImageNet上达到61%的top-1准确率),这得益于高效的集合通信与BTC加速。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。