Skip to main content
QUICK REVIEW

[논문 리뷰] GPU-based Data-parallel Rendering of Large, Unstructured, and Non-convexly Partitioned Data

Alper Sahistan, Serkan Demirci|arXiv (Cornell University)|2022. 09. 29.
Computer Graphics and Visualization Techniques인용 수 4
한 줄 요약

이 논문은 CFD 시뮬레이션과 같은 대규모 비구형, 비볼록으로 분할된 데이터셋을 위한 GPU 기반 데이터-병렬 직접 볼륨 렌더링 프레임워크를 제시한다. XOR 기반 인덱스 압축과 GPU 최적화된 딥 컴posit링 기법을 사용한다. 72개 GPU에서 14 GB, 798M 요소의 데이터셋에 대해 14–15 fps의 인터랙티브 프레임 레이트를 달성했고, 80개 GPU에서 111.57 GB, 6.4B 요소의 데이터셋에 대해 10.27 fps를 기록했다. 이는 데이터 재분배 없이도 비볼록이고 분산된 클러스터 간에 정확한 컴포지팅을 가능하게 한다.

ABSTRACT

Computational fluid dynamic simulations often produce large clusters of finite elements with non-trivial, non-convex boundaries and uneven distributions among compute nodes, posing challenges to compositing during interactive volume rendering. Correct, in-place visualization of such clusters becomes difficult because viewing rays straddle domain boundaries across multiple compute nodes. We propose a GPU-based, scalable, memory-efficient direct volume visualization framework suitable for in~situ and post~hoc usage. Our approach reduces memory usage of the unstructured volume elements by leveraging an exclusive or-based index reduction scheme and provides fast ray-marching-based traversal without requiring large external data structures built over the elements themselves. Moreover, we present a GPU-optimized deep compositing scheme that allows correct order compositing of intermediate color values accumulated across different ranks that works even for non-convex clusters. Our method scales well on large data-parallel systems and achieves interactive frame rates during visualization. We can interactively render both Fun3D Small Mars Lander (14 GB / 798.4 million finite elements) and Huge Mars Lander (111.57 GB / 6.4 billion finite elements) data sets at 14 and 10 frames per second using 72 and 80 GPUs, respectively, on TACC's Frontera supercomputer.

연구 동기 및 목표

  • 데이터 재분배 없이도 대규모 비구형, 비볼록으로 분할된 시뮬레이션 데이터에 대해 상호작용적이고 정확한 시각화를 가능하게 하기 위해.
  • 데이터-병렬 렌더링 환경에서 비볼록이고 불규칙하게 분포된 유한요소 클러스터 간의 컴포지팅 문제를 해결하기 위해.
  • 렌더링 성능이나 정확성에 손상 없이도 비구형 메쉬 표현에서의 메모리 사용량을 줄이기 위해.
  • 최소한의 컴포지팅 오버헤드로 대규모 GPU 클러스터(최대 80개 GPU)에 효율적으로 스케일링하기 위해.
  • 다중 스칼라 필드와 타임스텝을 포함한 복잡한 CFD 데이터셋에 대해 인-사이트 및 후처리 시각화를 지원하기 위해.

제안 방법

  • 비구형 유한요소 데이터 구조의 메모리 프로필을 줄이기 위해 XOR 기반의 인덱스 압축 기법을 사용한다.
  • 큰 외부 데이터 구조가 필요 없이도 레이 세그먼트를 뷰잉 레이에 따라 순차적으로 탐색하는 혼합 요소 레이-마치어를 활용한다.
  • 비볼록 클러스터 경계를 넘어선다 해도 여러 컴퓨팅 노드 간에 RGBA-Z 값이 정확히 컴포지팅되는 GPU 최적화된 딥 컴포지팅 알고리즘을 도입한다.
  • 시뮬레이션 출력에서 얻은 원본 비볼록 파artition을 그대로 활용하여 비용이 많이 드는 데이터 재분배를 방지한다.
  • Frontera 슈퍼컴퓨터에서 18개 노드와 72~80개 GPU에 걸쳐 확장 가능한 MPI와 CUDA 기반의 데이터-병렬 아키텍처를 사용한다.
  • 수렴 문제를 야기하는 점 쿼리 샘플링 기법과는 달리, 노이즈 없고 결정론적인 레이-마치어 접근 방식을 적용한다.

실험 결과

연구 질문

  • RQ1데이터-병렬 GPU 렌더링 시스템에서 비볼록이고 불규칙하게 분할된 비구형 메쉬에 대해 딥 컴포지팅을 효율적이고 정확하게 수행할 수 있는가?
  • RQ2렌더링 성능이나 정확성에 손상 없이도 비구형 메쉬 표현에서의 메모리 사용량을 어떻게 줄일 수 있는가?
  • RQ3원본 시뮬레이션 파artition을 그대로 사용하여도 대규모 비볼록으로 분할된 CFD 데이터셋에 대해 인터랙티브 프레임 레이트를 달성할 수 있는가?
  • RQ4불균형한 로드 분포 조건에서도 증가하는 GPU 수에 따른 제안된 프레임워크의 확장성은 어떠한가?
  • RQ5메모리, 노이즈, 수렴 측면에서 제안된 레이-마치어의 성능은 점 쿼리 샘플링 기법과 비교해 어떻게 되는가?

주요 결과

  • 작은 마스 랜더 데이터셋(14 GB, 798.4M 요소)에 대해 72개 GPU에서 15.14 fps를 기록했고, 컴포지팅 비용은 총 시간의 22.68% 이하로 일관되게 유지되었다.
  • 더 큰 허츠 마스 랜더 데이터셋(111.57 GB, 6.4B 요소)에 대해 80개 GPU를 사용해 10.27 fps를 달성했으며, 강력한 확장성 잠재력을 보였다.
  • GPU 수에 관계없이 컴포지팅 오버헤드가 거의 일정하게 유지되어 고도의 확장성과 낮은 통신 비용을 의미한다.
  • 작은 마스 랜더의 경우 24개 GPU, 큰 마스 랜더의 경우 32개 GPU에서 성능 급상승이 관찰되어 최적의 확장성 임계점이 존재함을 시사한다.
  • XOR 기반의 압축은 메모리 사용량을 줄였고, 딥 컴포지팅 기법은 비볼록이고 분산된 클러스터 간의 순서 기반 컴포지팅을 정확히 처리한다.
  • 점 쿼리 샘플링 기법과 달리 수렴 지연 없이 결정론적이고 노이즈 없는 이미지를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.