Skip to main content
QUICK REVIEW

[论文解读] Recognition of convolutional neural network based on CUDA Technology

Yibin Huang, Kang Li|arXiv (Cornell University)|May 30, 2015
Advanced Algorithms and Applications参考文献 1被引用 6
一句话总结

本文提出了一种基于NVIDIA GTX200 GPU的CUDA技术的卷积神经网络(CNN)并行识别算法,相较于串行CPU实现,速度提升了近60倍。结果表明,由于CUDA架构上的优化数据结构和任务映射,基于GPU的流处理在CNN推理方面显著优于CPU。

ABSTRACT

For the problem whether Graphic Processing Unit(GPU),the stream processor with high performance of floating-point computing is applicable to neural networks, this paper proposes the parallel recognition algorithm of Convolutional Neural Networks(CNNs).It adopts Compute Unified Device Architecture(CUDA)technology, definite the parallel data structures, and describes the mapping mechanism for computing tasks on CUDA. It compares the parallel recognition algorithm achieved on GPU of GTX200 hardware architecture with the serial algorithm on CPU. It improves speed by nearly 60 times. Result shows that GPU based the stream processor architecture ate more applicable to some related applications about neural networks than CPU.

研究动机与目标

  • 研究GPU流处理器在神经网络计算中的适用性。
  • 设计一种基于CUDA的并行CNN识别算法,以实现高性能浮点运算。
  • 从速度和效率角度,对比基于GPU的CNN推理与传统的CPU实现。
  • 评估CUDA映射机制和数据结构在CNN工作负载中的有效性。

提出的方法

  • 作者在GTX200 GPU硬件上使用计算统一设备架构(CUDA)实现了一种并行CNN识别算法。
  • 他们定义了专用的并行数据结构,以优化CNN层中的内存访问和数据流。
  • 明确描述了将CNN计算任务映射到CUDA内核的过程,从而实现GPU的高效执行。
  • 使用相同的网络架构和输入数据,将该算法与串行CPU实现进行基准测试。
  • 性能以执行时间以及相对于CPU基线的速度提升来衡量。
  • 研究聚焦于卷积层和全连接层,重点在于深度学习中常见的浮点运算。

实验结果

研究问题

  • RQ1与传统CPU相比,GPU流处理器能否显著加速CNN推理?
  • RQ2CUDA在将CNN计算任务映射到并行GPU执行单元方面有多高效?
  • RQ3通过为GPU执行重新设计串行CNN算法,可实现多大的性能提升?
  • RQ4定制的并行数据结构如何影响CNN中的内存访问和计算吞吐量?

主要发现

  • 基于GPU的CNN实现相较于串行CPU版本实现了近60倍的速度提升。
  • 结果证实,GPU流处理比CPU更适合处理某些神经网络工作负载。
  • 使用CUDA支持的并行数据结构和任务映射显著提升了计算效率。
  • 性能提升归因于GTX200 GPU的高精度浮点运算能力和大规模并行性。
  • 本研究证明,GPU加速在CNN推理任务中是可行且极为有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。