[论文解读] RankMap: A Platform-Aware Framework for Distributed Learning from Dense Datasets
RankMap 是一种平台感知的分布式框架,通过稀疏矩阵分解利用低秩结构,在密集数据集上加速迭代机器学习。通过将密集数据分解为低秩稀疏分量,RankMap 降低了内存、通信和计算成本——在保持学习准确性的前提下,相比先前工作性能最高提升两个数量级。
This paper introduces RankMap, a platform-aware end-to-end framework for efficient execution of a broad class of iterative learning algorithms for massive and dense datasets. Our framework exploits data structure to factorize it into an ensemble of lower rank subspaces. The factorization creates sparse low-dimensional representations of the data, a property which is leveraged to devise effective mapping and scheduling of iterative learning algorithms on the distributed computing machines. We provide two APIs, one matrix-based and one graph-based, which facilitate automated adoption of the framework for performing several contemporary learning applications. To demonstrate the utility of RankMap, we solve sparse recovery and power iteration problems on various real-world datasets with up to 1.8 billion non-zeros. Our evaluations are performed on Amazon EC2 and IBM iDataPlex servers using up to 244 cores. The results demonstrate up to two orders of magnitude improvements in memory usage, execution speed, and bandwidth compared with the best reported prior work, while achieving the same level of learning accuracy.
研究动机与目标
- 解决现有图并行框架在处理高通信和存储开销的密集、结构化数据集时的低效问题。
- 通过数据感知分解和平台感知调度,实现大规模密集数据集上迭代学习算法的可扩展、高效执行。
- 通过将密集数据转换为稀疏低秩表示,降低分布式系统中的计算和通信成本。
- 提供开源、可扩展的 API(基于矩阵和基于顶点的模型),实现与现有机器学习流水线的无缝集成。
- 在真实世界数据集和异构硬件上,显著提升内存、带宽和执行速度。
提出的方法
- RankMap 通过基于采样的低秩近似方法,将密集、结构化的数据集分解为两个稀疏矩阵,大幅减少非零元素数量。
- 采用可扩展的、误差有界的分解方法,可调节近似精度以满足特定应用需求。
- 框架采用平台感知的矩阵划分策略,最小化分布式环境中的通信量和负载不平衡。
- 提供两种计算模型:基于 MPI 的矩阵模型和基于 GraphLab 的顶点中心模型,分别针对不同稀疏度的数据场景进行优化。
- 系统与迭代求解器(如 FISTA)集成,并支持在分解后的数据上扩展至随机方法(如 SGD 和 SCD)。
- 推导出性能边界和通信成本分析,表明具有接近最优的可扩展性,并降低对计算节点数量的依赖。
实验结果
研究问题
- RQ1密集数据集中的低秩结构能否被有效利用以降低分布式迭代学习中的通信和内存开销?
- RQ2如何高效计算和划分稀疏矩阵分解,以保持负载均衡并最小化数据移动?
- RQ3在分布式环境中,基于矩阵的模型与基于顶点的模型之间存在哪些性能权衡?
- RQ4平台感知调度与数据感知转换能在多大程度上提升运行时间、内存使用和能效?
- RQ5能否构建一个统一的开源框架,以支持大规模密集数据上的多样化迭代学习算法?
主要发现
- 与先前工作相比,RankMap 在包含最多 18 亿个非零元素的数据集上,将内存使用、执行时间和通信带宽降低了两个数量级。
- 在 4 个 IBM iDataPlex 节点上,18 亿个非零元素的数据集分解过程在 15 分钟内完成,实现了对光场补丁的重建时间低于 20 秒。
- 矩阵模型在大多数情况下性能优于顶点中心模型,因其开销更低;然而,在具有块对角结构的高节点数场景下,图模型展现出更好的可扩展性。
- 对于 10 个长度为 18k 的光场补丁,重建时间从超过 1000 秒降低至 20 秒以内,验证了离线分解成本的合理性。
- 在使用最多 244 个核心的 Amazon EC2 和 IBM iDataPlex 集群上,RankMap 在保持与基线方法相同学习准确性的前提下,显著降低了计算和通信成本。
- 基于矩阵和顶点中心模型的开源 API 已发布,支持与标准优化方法(如 FISTA、SGD 和 SCD)的集成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。