Skip to main content
QUICK REVIEW

[论文解读] Comparative Performance Analysis of Intel Xeon Phi, GPU, and CPU

George Teodoro, Tahsin Kurç|arXiv (Cornell University)|Nov 2, 2013
Advanced Neural Network Applications参考文献 33被引用 13
一句话总结

本文比较了在图像分析工作负载中,Intel Xeon Phi(MIC)、GPU 和 CPU 架构的性能表现,重点关注数据访问模式与并行化策略。研究发现,在不规则内存访问场景下,GPU 的性能显著优于 MIC;而在规则访问模式下,MIC 的性能可与 GPU 相当甚至更优;通过协同任务调度,性能提升 1.29 倍,在包含 3072 个 CPU 核心和 192 个 MIC 的 192 节点集群上实现了 84% 的效率。

ABSTRACT

We investigate and characterize the performance of an important class of operations on GPUs and Many Integrated Core (MIC) architectures. Our work is motivated by applications that analyze low-dimensional spatial datasets captured by high resolution sensors, such as image datasets obtained from whole slide tissue specimens using microscopy image scanners. We identify the data access and computation patterns of operations in object segmentation and feature computation categories. We systematically implement and evaluate the performance of these core operations on modern CPUs, GPUs, and MIC systems for a microscopy image analysis application. Our results show that (1) the data access pattern and parallelization strategy employed by the operations strongly affect their performance. While the performance on a MIC of operations that perform regular data access is comparable or sometimes better than that on a GPU; (2) GPUs are significantly more efficient than MICs for operations and algorithms that irregularly access data. This is a result of the low performance of the latter when it comes to random data access; (3) adequate coordinated execution on MICs and CPUs using a performance aware task scheduling strategy improves about 1.29x over a first-come-first-served strategy. The example application attained an efficiency of 84% in an execution with of 192 nodes (3072 CPU cores and 192 MICs).

研究动机与目标

  • 评估并表征关键图像分析操作在 CPU、GPU 和 Intel Xeon Phi(MIC)架构上的性能表现。
  • 识别数据访问模式与并行化策略如何影响各类协处理器的性能表现。
  • 在分布式内存系统中,研究通过性能感知任务调度实现 CPU 与 MIC 的协同执行。
  • 为应用开发者提供依据操作特征选择最优协处理器的指导建议。
  • 通过混合 CPU-MIC 集群在真实世界数字病理学应用中,展示高可扩展性与高效率。

提出的方法

  • 在 CPU、GPU 和 MIC 上系统性地实现并基准测试核心图像分析操作——数据清洗、目标分割、特征计算、聚合、分类与配准。
  • 根据数据访问模式对操作进行分类:规则访问(如遍历)、不规则访问(如随机访问)以及全局访问(如规约操作)。
  • 利用微内核性能测量,将协处理器特性与操作行为进行关联分析。
  • 设计并评估一种性能感知的任务调度策略,以协调 CPU 与 MIC 的执行,最小化空闲时间和通信开销。
  • 在包含 3072 个 CPU 核心和 192 个 MIC 的 192 节点集群上执行真实数字病理学应用,以测量端到端效率。
  • 通过执行时间、加速比和强可扩展性效率等指标,对比不同架构的性能表现。

实验结果

研究问题

  • RQ1不同的数据访问模式(规则 vs. 不规则)如何影响 GPU、CPU 和 MIC 的性能表现?
  • RQ2在何种场景下,Intel Xeon Phi 相较于 GPU 和 CPU 表现更优或更差?
  • RQ3CPU 与 MIC 之间的协同任务调度如何影响整体应用性能与可扩展性?
  • RQ4计算强度与并行化策略对跨协处理器类型性能可移植性有何影响?
  • RQ5性能感知调度在混合 CPU-MIC 集群中,对图像分析工作负载的效率提升程度如何?

主要发现

  • 在涉及频繁原子操作的不规则数据访问操作中,GPU 显著优于 MIC,主要由于 MIC 的随机内存访问性能较差。
  • 在具有规则数据访问与计算模式的操作中,MIC 的性能与 GPU 相当,甚至在某些情况下更优。
  • 与先来先服务策略相比,性能感知任务调度策略在 CPU-MIC 协同执行中使应用性能提升 1.29 倍。
  • 在包含 3072 个 CPU 核心和 192 个 MIC 的 192 节点集群上,使用性能感知调度策略,该数字病理学应用实现了 84% 的效率。
  • 由于计算与数据访问模式的差异,各类操作之间存在显著的性能波动,因此需要根据操作特征选择特定的协处理器。
  • 研究结果为应用开发者提供了切实可行的指导,可根据访问与计算特性将操作映射到最合适的协处理器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。