Skip to main content
QUICK REVIEW

[论文解读] GPU-based Data-parallel Rendering of Large, Unstructured, and Non-convexly Partitioned Data

Alper Sahistan, Serkan Demirci|arXiv (Cornell University)|Sep 29, 2022
Computer Graphics and Visualization Techniques被引用 4
一句话总结

本论文提出了一种基于GPU的、面向大规模非凸分区非结构化数据集(如CFD模拟数据)的数据并行直接体绘制框架,采用XOR索引压缩技术与GPU优化的深度合成方案。该框架在72块GPU上对14 GB、7.98亿个元素的数据集实现了14–15 fps的交互帧率,在80块GPU上对111.57 GB、64亿个元素的数据集实现了10.27 fps的帧率,无需数据重分布即可在非凸分布的计算集群中实现正确合成。

ABSTRACT

Computational fluid dynamic simulations often produce large clusters of finite elements with non-trivial, non-convex boundaries and uneven distributions among compute nodes, posing challenges to compositing during interactive volume rendering. Correct, in-place visualization of such clusters becomes difficult because viewing rays straddle domain boundaries across multiple compute nodes. We propose a GPU-based, scalable, memory-efficient direct volume visualization framework suitable for in~situ and post~hoc usage. Our approach reduces memory usage of the unstructured volume elements by leveraging an exclusive or-based index reduction scheme and provides fast ray-marching-based traversal without requiring large external data structures built over the elements themselves. Moreover, we present a GPU-optimized deep compositing scheme that allows correct order compositing of intermediate color values accumulated across different ranks that works even for non-convex clusters. Our method scales well on large data-parallel systems and achieves interactive frame rates during visualization. We can interactively render both Fun3D Small Mars Lander (14 GB / 798.4 million finite elements) and Huge Mars Lander (111.57 GB / 6.4 billion finite elements) data sets at 14 and 10 frames per second using 72 and 80 GPUs, respectively, on TACC's Frontera supercomputer.

研究动机与目标

  • 在无需数据重分布的前提下,实现对大规模、非结构化、非凸分区模拟数据的交互式、正确可视化。
  • 解决在数据并行渲染中,跨非凸、不规则分布的有限元簇进行合成的挑战。
  • 在保持高效光线追踪性能的同时,减少非结构化网格表示的内存占用。
  • 在大规模GPU集群(最高达80块GPU)上实现高效扩展,且合成开销极低。
  • 支持复杂CFD数据集的原位与事后可视化,包含多个标量场和时间步长。

提出的方法

  • 采用基于XOR的索引压缩方案,减少非结构化有限元数据结构的内存占用。
  • 使用混合元素光线追踪器,沿视线方向遍历光线段,无需大型外部数据结构。
  • 提出一种GPU优化的深度合成算法,可在多个计算节点之间正确合成RGBA-Z值,即使跨越非凸集群边界亦可。
  • 利用模拟输出中的原生非凸分区,避免昂贵的数据重分布操作。
  • 采用基于MPI与CUDA的数据并行架构,在Frontera超算系统上实现18个计算节点、72–80块GPU的扩展。
  • 采用确定性、无噪声的光线追踪方法,避免点查询采样方法的收敛问题。

实验结果

研究问题

  • RQ1在数据并行GPU渲染系统中,能否实现高效且正确的非凸、不规则分区非结构化网格的深度合成?
  • RQ2如何在不牺牲渲染性能或正确性的情况下,减少非结构化网格表示的内存使用?
  • RQ3能否利用原生模拟分区,在非凸分区的大规模CFD数据集上实现交互式帧率?
  • RQ4该框架在GPU数量增加时的可扩展性如何,尤其是在负载分布不均的情况下?
  • RQ5与点查询采样技术相比,所提出的光线追踪器在内存占用、噪声水平和收敛性方面表现如何?

主要发现

  • 在72块GPU上,该框架对Small Mars Lander数据集(14 GB,7.984亿个元素)实现了15.14 fps的帧率,合成开销始终低于总耗时的22.68%。
  • 对于更大的Huge Mars Lander数据集(111.57 GB,64亿个元素),系统在80块GPU上实现了10.27 fps的帧率,表现出良好的可扩展性。
  • 合成开销在GPU数量增加时几乎保持不变,表明具有高可扩展性且通信开销低。
  • 在Small Mars Lander数据集中,光线追踪器在24块GPU时性能显著提升;Huge Mars Lander数据集则在32块GPU时出现类似趋势,表明存在最优扩展阈值。
  • 基于XOR的压缩技术有效降低了内存使用,而深度合成方法能正确处理非凸、分布式集群中的顺序合成。
  • 该方法保持了确定性、无噪声的图像输出,无收敛延迟,优于点查询采样技术。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。