Skip to main content
QUICK REVIEW

[論文レビュー] P-Cloth: Interactive Complex Cloth Simulation on Multi-GPU Systems using Dynamic Matrix Assembly and Pipelined Implicit Integrators

Cheng Li, Min Tang|arXiv (Cornell University)|Aug 2, 2020
3D Shape Modeling and Analysis参考文献 59被引用数 11
ひとこと要約

P-Cloth は、パイプライン化されたスパース行列・ベクトル乗算 (SpMV)、動的行列構築、空間ハッシュを用いたパイプライン化された衝突処理を用いて、インタラクティブで高解像度の布のシミュレーションを実現するマルチGPU並列アルゴリズムを提示する。1.65M個の三角形を有する複雑なメッシュにおいて、4〜8 GPUでほぼ線形のスループット向上を実現し、2〜5 fpsを達成することで、コンsumer用マルチGPUワークステーションで準インタラクティブなパフォーマンスを初めて実現した。

ABSTRACT

We present a novel parallel algorithm for cloth simulation that exploits multiple GPUs for fast computation and the handling of very high resolution meshes. To accelerate implicit integration, we describe new parallel algorithms for sparse matrix-vector multiplication (SpMV) and for dynamic matrix assembly on a multi-GPU workstation. Our algorithms use a novel work queue generation scheme for a fat-tree GPU interconnect topology. Furthermore, we present a novel collision handling scheme that uses spatial hashing for discrete and continuous collision detection along with a non-linear impact zone solver. Our parallel schemes can distribute the computation and storage overhead among multiple GPUs and enable us to perform almost interactive simulation on complex cloth meshes, which can hardly be handled on a single GPU due to memory limitations. We have evaluated the performance with two multi-GPU workstations (with 4 and 8 GPUs, respectively) on cloth meshes with 0.5-1.65M triangles. Our approach can reliably handle the collisions and generate vivid wrinkles and folds at 2-5 fps, which is significantly faster than prior cloth simulation systems. We observe almost linear speedups with respect to the number of GPUs.

研究の動機と目的

  • 100万以上の三角形を有する高解像度メッシュのシングルGPU布のシミュレーションにおけるメモリおよび計算上のボトル neck を解決すること。
  • 自己衝突と詳細なしわを伴う複雑な布のシミュレーションにおいて、シングルGPUのメモリ容量および低帯域幅の制限を克服すること。
  • 複数のGPUに計算およびストレージを分散させることで、コンsumer用マルチGPUワークステーション上でインタラクティブなシミュレーション(2〜8 fps)を可能にすること。
  • データ転送および同期オーバーヘッドを最小限に抑える低遅延のスケーラブルな並列アルゴリズムを、陰的時間積分および衝突処理に開発すること。
  • パフォーマンスおよびメモリ使用量の線形的スケーラビリティを、衝突応答の強固さとリアルな布のダイナミクスを維持しながら、複数GPUにわたって達成すること。

提案手法

  • ファットツリーGPUインタコネクトに最適化された新しいワークキュー生成方式を用いて、GPU間で計算とデータ転送をインタリーブするパイプライン化SpMVアルゴリズムを提案する。
  • シミュレーション中の接触力の変化に適応する動的行列構築を導入し、プリコンディショニング付き共役勾配(PCG)ソルバとの効率的連携を可能にする。
  • 離散的および連続的衝突検出の両方において空間ハッシュを用い、GPU間で負荷を分散させることで、GPU1台あたりのメモリ使用量を削減する。
  • 最小限の同期で侵入を処理する並列非線形インパクトゾーンソルバを設計し、安定的かつ現実的な衝突応答を保証する。
  • 通信遅延を低減しスループットを向上させるために、最適化されたデータ転送スケジューリングを施したファットツリーGPUインタコネクトトポロジを採用する。
  • すべてのモジュールを統合した包括的なマルチGPUパイプラインを構築し、陰的時間積分、動的行列更新、衝突解消をスケーラブルかつ負荷分散された形でサポートする。

実験結果

リサーチクエスチョン

  • RQ1マルチGPUシステムは、100万個を超える三角形を有する高解像度メッシュで、準インタラクティブな布のシミュレーション(2〜5 fps)を達成できるか?
  • RQ2ファットツリーGPUインタコネクトに最適化された動的行列構築およびパイプライン化SpMVは、通信オーバーヘッドを最小限に抑え、スループットを最大化できるか?
  • RQ3空間ハッシュを用いた並列衝突検出および応答は、複数GPUにわたって効果的にスケーリング可能であり、GPU1台あたりのメモリ使用量を削減できるか?
  • RQ4シングルGPUまたはCPUベースのシステムと比較して、4〜8 GPUでどの程度のスループット向上とスケーラビリティが達成できるか?
  • RQ5複数GPUに計算を分散させても、シミュレーションの安定性およびリアリズム(しわ、折りたたみ、摩擦など)を維持することは可能か?

主な発見

  • P-Cloth は、4〜8 GPUを用いて、0.5〜165万三角形の複雑な布メッシュで2〜5 fpsを達成し、コンsumer用ワークステーション上で準インタラクティブなシミュレーションを実現した。
  • 1台のGPUと比較して、最大8.23倍のスループット向上を達成し、ほぼ線形のスループット向上を示した。また、先行するマルチGPU SpMV手法と比較して1.4〜2.2倍の高速化を達成した。
  • GPU1台あたりのメモリ使用量は4〜8 GBにまで削減され、シングルGPUのメモリ制限を超える高解像度メッシュのシミュレーションが可能になった。
  • パイプライン化SpMVおよび動的行列構築技術は、GPU数に対して線形的スケーラビリティを示し、マルチGPUリソースの効率的活用を可能にした。
  • GPU間での衝突処理は効果的にスケーリングされ、最小限の同期オーバーヘッドで、複雑な自己衝突および折りたたみのシミュレーションが可能になった。
  • 複雑なベンチマークにおいて、P-Cloth は先行するCPUベースおよびハイブリッドCPU-GPUシステムを約10倍高速にし、類似メッシュで同様の性能を示すJiangら(2017)のシステムよりも顕著に高いフレームレートを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。