[论文解读] The Potential of the Intel Xeon Phi for Supervised Deep Learning
本文提出 CHAOS,一种并行化框架,通过在英特尔至强融核协处理器上同时利用线程级并行和SIMD并行,以加速卷积神经网络(CNN)的监督训练。通过在至强融核7120P上利用244个线程,作者实现了相较于单线程CPU训练的103.5倍加速,将MNIST数据集上大型CNN的训练时间从31小时减少至3小时,同时建立了经过验证的性能模型,用于可扩展性分析。
Supervised learning of Convolutional Neural Networks (CNNs), also known as supervised Deep Learning, is a computationally demanding process. To find the most suitable parameters of a network for a given application, numerous training sessions are required. Therefore, reducing the training time per session is essential to fully utilize CNNs in practice. While numerous research groups have addressed the training of CNNs using GPUs, so far not much attention has been paid to the Intel Xeon Phi coprocessor. In this paper we investigate empirically and theoretically the potential of the Intel Xeon Phi for supervised learning of CNNs. We design and implement a parallelization scheme named CHAOS that exploits both the thread- and SIMD-parallelism of the coprocessor. Our approach is evaluated on the Intel Xeon Phi 7120P using the MNIST dataset of handwritten digits for various thread counts and CNN architectures. Results show a 103.5x speed up when training our large network for 15 epochs using 244 threads, compared to one thread on the coprocessor. Moreover, we develop a performance model and use it to assess our implementation and answer what-if questions.
研究动机与目标
- 研究英特尔至强融核协处理器在加速卷积神经网络(CNN)监督深度学习方面的潜力。
- 设计并实现一种并行化方案,有效利用至强融核架构上的线程级并行和SIMD并行。
- 通过在MNIST数据集上使用不同CNN架构和线程数量,评估所提方法的性能。
- 建立并验证一个性能模型,以评估实现效率,并支持超越当前硬件限制的“假设”可扩展性分析。
提出的方法
- CHAOS框架利用线程级并行将输入样本分配到多个线程,实现训练数据的并发处理。
- 在卷积层内部应用SIMD并行,以加速偏导数和权重梯度的计算。
- 该方法在英特尔至强融核7120P协处理器上实现,充分利用其众核架构和向量单元。
- 基于实验测量和理论分析,建立性能模型,以预测执行时间和可扩展性。
- 通过在MNIST数据集上使用不同线程数和网络架构进行训练的实验结果,对模型进行验证。
- 在10,000张训练图像和10,000张测试图像上,对小型和大型CNN架构对框架进行了评估。
实验结果
研究问题
- RQ1与单线程CPU相比,英特尔至强融核协处理器能否在CNN监督训练中实现显著加速?
- RQ2在至强融核架构上,线程级并行和SIMD并行在CNN训练中能被多大程度地有效利用?
- RQ3随着线程数量的增加,CHAOS框架的可扩展性如何,特别是在超过当前硬件线程数量的情况下?
- RQ4所提出的性能模型在多大程度上能准确预测执行时间,并指导未来至强融核代际的优化?
主要发现
- 在英特尔至强融核7120P上使用244个线程训练大型CNN 15个周期时,CHAOS框架实现了103.5倍的加速,相较于CPU单线程训练。
- 训练时间从英特尔至强E5上的31小时缩短至至强融核7120P上的3小时,展示了显著的性能提升。
- 性能模型准确预测了执行时间,并支持可扩展性分析,表明在固定线程数下,图像数量或周期数加倍时,执行时间也大致加倍。
- 在固定周期数和图像数下,线程数加倍并未使执行时间减半,表明由于数据依赖和内存瓶颈,存在收益递减现象。
- 模型预测,未来具有更多硬件线程的至强融核代际产品可实现更大的加速,表明存在进一步优化的潜力。
- 本研究是首次针对英特尔至强融核平台开展的监督CNN训练研究,填补了该平台在深度学习研究中的空白。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。