[论文解读] GPU-based Data-parallel Rendering of Large, Unstructured, and Non-convexly Partitioned Data
本论文提出了一种基于GPU的、面向大规模非凸分区非结构化数据集(如CFD模拟数据)的数据并行直接体绘制框架,采用XOR索引压缩技术与GPU优化的深度合成方案。该框架在72块GPU上对14 GB、7.98亿个元素的数据集实现了14–15 fps的交互帧率,在80块GPU上对111.57 GB、64亿个元素的数据集实现了10.27 fps的帧率,无需数据重分布即可在非凸分布的计算集群中实现正确合成。
Computational fluid dynamic simulations often produce large clusters of finite elements with non-trivial, non-convex boundaries and uneven distributions among compute nodes, posing challenges to compositing during interactive volume rendering. Correct, in-place visualization of such clusters becomes difficult because viewing rays straddle domain boundaries across multiple compute nodes. We propose a GPU-based, scalable, memory-efficient direct volume visualization framework suitable for in~situ and post~hoc usage. Our approach reduces memory usage of the unstructured volume elements by leveraging an exclusive or-based index reduction scheme and provides fast ray-marching-based traversal without requiring large external data structures built over the elements themselves. Moreover, we present a GPU-optimized deep compositing scheme that allows correct order compositing of intermediate color values accumulated across different ranks that works even for non-convex clusters. Our method scales well on large data-parallel systems and achieves interactive frame rates during visualization. We can interactively render both Fun3D Small Mars Lander (14 GB / 798.4 million finite elements) and Huge Mars Lander (111.57 GB / 6.4 billion finite elements) data sets at 14 and 10 frames per second using 72 and 80 GPUs, respectively, on TACC's Frontera supercomputer.
研究动机与目标
- 在无需数据重分布的前提下,实现对大规模、非结构化、非凸分区模拟数据的交互式、正确可视化。
- 解决在数据并行渲染中,跨非凸、不规则分布的有限元簇进行合成的挑战。
- 在保持高效光线追踪性能的同时,减少非结构化网格表示的内存占用。
- 在大规模GPU集群(最高达80块GPU)上实现高效扩展,且合成开销极低。
- 支持复杂CFD数据集的原位与事后可视化,包含多个标量场和时间步长。
提出的方法
- 采用基于XOR的索引压缩方案,减少非结构化有限元数据结构的内存占用。
- 使用混合元素光线追踪器,沿视线方向遍历光线段,无需大型外部数据结构。
- 提出一种GPU优化的深度合成算法,可在多个计算节点之间正确合成RGBA-Z值,即使跨越非凸集群边界亦可。
- 利用模拟输出中的原生非凸分区,避免昂贵的数据重分布操作。
- 采用基于MPI与CUDA的数据并行架构,在Frontera超算系统上实现18个计算节点、72–80块GPU的扩展。
- 采用确定性、无噪声的光线追踪方法,避免点查询采样方法的收敛问题。
实验结果
研究问题
- RQ1在数据并行GPU渲染系统中,能否实现高效且正确的非凸、不规则分区非结构化网格的深度合成?
- RQ2如何在不牺牲渲染性能或正确性的情况下,减少非结构化网格表示的内存使用?
- RQ3能否利用原生模拟分区,在非凸分区的大规模CFD数据集上实现交互式帧率?
- RQ4该框架在GPU数量增加时的可扩展性如何,尤其是在负载分布不均的情况下?
- RQ5与点查询采样技术相比,所提出的光线追踪器在内存占用、噪声水平和收敛性方面表现如何?
主要发现
- 在72块GPU上,该框架对Small Mars Lander数据集(14 GB,7.984亿个元素)实现了15.14 fps的帧率,合成开销始终低于总耗时的22.68%。
- 对于更大的Huge Mars Lander数据集(111.57 GB,64亿个元素),系统在80块GPU上实现了10.27 fps的帧率,表现出良好的可扩展性。
- 合成开销在GPU数量增加时几乎保持不变,表明具有高可扩展性且通信开销低。
- 在Small Mars Lander数据集中,光线追踪器在24块GPU时性能显著提升;Huge Mars Lander数据集则在32块GPU时出现类似趋势,表明存在最优扩展阈值。
- 基于XOR的压缩技术有效降低了内存使用,而深度合成方法能正确处理非凸、分布式集群中的顺序合成。
- 该方法保持了确定性、无噪声的图像输出,无收敛延迟,优于点查询采样技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。