Skip to main content
QUICK REVIEW

[論文レビュー] Improved Fast Iterative Algorithm for Eikonal Equation for GPU Computing

Yuhao Huang|arXiv (Cornell University)|Jun 30, 2021
Numerical Methods and Algorithms参考文献 12被引用数 4
ひとこと要約

本稿では、値の更新中に収束チェックを削除し、誤差を補正する別々の手順を導入することで、GPU上でEikonal方程式を解くための改善された高速反復法(iFIM)を提案する。この手法は、SIMDアーキテクチャを効率的に活用し、ソート構造への依存を減らすことで、FIM、FMM、FSSMよりも高速な性能を達成する。

ABSTRACT

In this paper we propose an improved fast iterative method to solve the Eikonal equation, which can be implemented in parallel. We improve the fast iterative method for Eikonal equation in two novel ways, in the value update and in the error correction. The new value update is very similar to the fast iterative method in that we selectively update the points, chosen by a convergence measure, in the active list. However, in order to reduce running time, the improved algorithm does not run a convergence check of the neighboring points of the narrow band as the fast iterative method usually does. The additional error correction step is to correct the errors that the previous value update step may cause. The error correction step consists of finding and recalculating the point values in a separate remedy list which is quite easy to implement on a GPU. In contrast to the fast marching method and the fast sweeping method for the Eikonal equation, our improved method does not need to compute the solution with any special ordering in neither the remedy list nor the active list. Therefore, our algorithm can be implemented in parallel. In our experiments, we implemente our new algorithm in parallel on a GPU and compare the elapsed time with other current algorithms. The improved fast iterative method runs faster than the other algorithms in most cases through our numercal studies.

研究の動機と目的

  • GPUアーキテクチャ上で既存の手法を上回る性能を発揮する、並列化可能なEikonal方程式の解法アルゴリズムの開発。
  • 並列化を妨げる計算コストの高い収束チェックを、高速反復法(FIM)から排除すること。
  • 値の更新中に生じた誤差を補正するための別々の補正リストを導入し、効率的なGPU実行を可能にすること。
  • ソートや逐次依存を避けることで、FMM や FSSM よりもGPU環境で高い性能を達成すること。
  • 現代のGPUストリーミングマルチプロセッサを活用した、スケーラブルなデータ並列計算によるEikonal方程式の計算を可能にすること。

提案手法

  • 改善された高速反復法(iFIM)は、FIMと同様に収束尺度に基づいて更新対象の点を選択するアクティブリストを用いるが、隣接点に対する収束チェックを省略する。
  • 更新ステップの後、誤差残差を持つ点を特定し再計算する新しい補正リストを導入し、誤差補正を並列に実行可能にする。
  • SIMD実行に不適切なデータ構造(例:ヒープソート)を維持しないため、GPUの並列性が向上する。
  • 局所ソルバーは、Eikonal方程式の1次精度Godunov上流有限差分離散化を用い、グリッドごとに2次方程式を解く。
  • スレッドブロックをカスタマイズ可能なGPUカーネル起動を活用し、メモリコalescingと割り当て効率を最適化するためにスレッド数を調整する。
  • 補正ステップは、単純な誤差閾値チェックを用いて誤った点を効率的に特定・修正する別々のカーネルとして実装される。

実験結果

リサーチクエスチョン

  • RQ1高速反復法における収束チェックステップを削除しても、解の精度が低下しないか?
  • RQ2並列GPU環境において、初期の更新による誤差伝搬を効率的に是正できるか?
  • RQ3ソートや逐次順序に依存しないGPU最適化Eikonalソルバーを設計できるか?
  • RQ4GPU並列環境において収束チェックの削除と補正ステップの追加による性能向上はどの程度か?
  • RQ5さまざまなEikonal問題設定において、iFIMアルゴリズムはFMM、FSSM、FIMと比べて速度と精度で優れているか?

主な発見

  • iFIMアルゴリズムはGPU上で元のFIMよりも一貫して高速に実行され、カーネルオーバヘッドの低減とより良いメモリアクセスパターンがその要因である。
  • 高速マーチング法(FMM)はヒープソートデータ構造の使用により、iFIMに比べて著しく遅く、GPU並列化に不適切である。
  • 可変速度関数では、FMMの性能はヒープ操作の増加によりさらに低下するが、iFIMは高い効率を維持する。
  • 補正ステップは、例2および例5における正確な解との視覚的・定量的比較により、更新フェーズで生じた誤差を効果的に是正していることが確認された。
  • iFIMの最適なパフォーマンスは、スレッド数の調整により達成され、N=2000²グリッドにおいて図12が特定のスレッド数での明確なパフォーマンスピークを示している。
  • iFIMはGPU上での実用的計算量がO(N)に抑えられ、FMMのO(N log N)を上回り、FSSMの理論的効率と同等の性能を達成するが、並列化がはるかに容易である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。