Skip to main content
QUICK REVIEW

[论文解读] Unimem: Runtime Data Management on Non-Volatile Memory-based Heterogeneous Main Memory

Kai Wu, Yingchao Huang|arXiv (Cornell University)|Apr 29, 2017
Parallel Computing and Optimization Techniques参考文献 14被引用 9
一句话总结

Unimem 是一种纯软件运行时系统,无需硬件修改或应用程序更改,即可自动管理基于非易失性内存(NVM)的异构主内存(HMS)中的数据放置。通过在线性能分析、轻量级性能模型以及借助辅助线程的主动数据迁移,Unimem 将 NVM 单独系统与 DRAM 单独系统之间的性能差距缩小至 7% 以内,覆盖多种 HPC 工作负载。

ABSTRACT

Non-volatile memory (NVM) provides a scalable and power-efficient solution to replace DRAM as main memory. However, because of relatively high latency and low bandwidth of NVM, NVM is often paired with DRAM to build a heterogeneous memory system (HMS). As a result, data objects of the application must be carefully placed to NVM and DRAM for best performance. In this paper, we introduce a lightweight runtime solution that automatically and transparently manage data placement on HMS without the requirement of hardware modifications and disruptive change to applications. Leveraging online profiling and performance models, the runtime characterizes memory access patterns associated with data objects, and minimizes unnecessary data movement. Our runtime solution effectively bridges the performance gap between NVM and DRAM. We demonstrate that using NVM to replace the majority of DRAM can be a feasible solution for future HPC systems with the assistance of a software-based data management.

研究动机与目标

  • 通过在异构内存系统(HMS)中实现高效的数据放置,解决 HPC 系统中 NVM 与 DRAM 之间的性能差距。
  • 消除对硬件修改、操作系统更改或程序员参与数据放置决策的需求。
  • 在确保对执行阶段变化的内存访问模式具有适应性和响应能力的同时,最小化数据移动带来的性能开销。
  • 为新兴的基于 NVM 的主内存架构上的遗留 HPC 应用程序提供透明且自动化的数据管理。

提出的方法

  • 使用性能计数器进行在线性能分析,以表征内存访问模式以及数据对象对带宽和延迟的敏感性。
  • 开发轻量级性能模型,以预测在 NVM 和 DRAM 之间移动数据的性能收益与成本。
  • 将数据放置决策建模为一个背包问题,以在最小化不必要的数据移动的同时最大化收益。
  • 通过辅助线程实现主动数据迁移机制,将数据迁移与应用程序执行重叠,隐藏移动开销。
  • 优化初始数据放置,并通过将大型数据对象分解以支持细粒度移动,提高适应性并降低开销。
  • 在局部阶段级搜索与全局跨阶段优化之间取得平衡,以实现接近最优的数据放置决策。

实验结果

研究问题

  • RQ1如何在无需硬件或应用程序更改的情况下,自动且透明地管理基于 NVM-DRAM 的异构主内存中的数据放置?
  • RQ2为做出有效的数据放置决策,必须捕捉哪些性能特征(带宽与延迟敏感性)?
  • RQ3如何在保持对执行阶段内存访问模式变化的适应性的同时,最小化数据移动?
  • RQ4哪些机制能够有效隐藏生产级 HPC 工作负载中数据移动的性能成本?
  • RQ5基于软件的数据管理在多大程度上可以缩小 NVM 单独系统与 DRAM 单独系统之间的性能差距?

主要发现

  • Unimem 在所有测试的 HPC 工作负载(包括 CG、MG 等)中,将 NVM 单独系统与 DRAM 单独系统之间的性能差距缩小至 7% 以内。
  • 在最具挑战性的配置(128MB DRAM)下,尽管 DRAM 容量有限且因大型不可分解数据对象导致利用率低下,Unimem 仍使性能差距缩小了 35%。
  • 该系统在不同 DRAM 大小和内存访问模式下均保持近乎透明的运行,对应用程序性能影响极小。
  • 通过辅助线程实现的主动数据移动成功隐藏了移动开销,使数据迁移不处于关键路径上。
  • 在线性能分析、性能建模与基于背包问题的优化相结合,实现了低运行时开销的有效且自适应的数据放置。
  • 该方法在多种工作负载和配置下均表现出鲁棒性,证明了其在基于 NVM 的系统中实际部署的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。