Skip to main content
QUICK REVIEW

[論文レビュー] Fully Parallel Particle Learning for GPGPUs and Other Parallel Devices

Kenichiro McAlinn, Teruo Nakatsuma|arXiv (Cornell University)|Dec 7, 2012
Target Tracking and Data Fusion in Sensor Networks参考文献 25被引用数 3
ひとこと要約

本稿では、粒子フィルタの全ステップ—尤度計算、CDF構築、リサンプリング、伝搬—をすべてGPU上で完全に並列に実行する、完全並列リサンプリングアルゴリズムを提案する。CPU-GPU間のデータ転送を排除することで、CDFステップで最大248倍の高速化、伝搬ステップで45.3倍の高速化を達成し、正確なリサンプリングを実現するcut-point法を用いる。

ABSTRACT

We develop a novel parallel resampling algorithm for fully parallelized particle filters, which is designed with GPUs (graphics processing units) or similar parallel computing devices in mind. With our new algorithm, a full cycle of particle filtering (computing the value of the likelihood for each particle, constructing the cumulative distribution function (CDF) for resampling, resampling the particles with the CDF, and propagating new particles for the next cycle) can be executed in a massively and completely parallel manner. One of the advantages of our algorithm is that every single numerical computation or memory access related to the particle filtering is executed solely inside the GPU in parallel, and no data transfer between the GPU's device memory and the CPU's host memory occurs unless for further processing, so that it can circumvent the limited memory bandwidth between the GPU and the CPU. To demonstrate the advantage of our parallel algorithm, we conducted a Monte Carlo experiment in which we apply the parallel algorithm as well as conventional sequential algorithms for estimation of a simple state space model via particle learning, and compare them in terms of execution time. The results show that the parallel algorithm is far superior to the sequential algorithm.

研究の動機と目的

  • 高次元で非線形的かつ非ガウス的な状態空間モデルにおける粒子フィルタリングの計算ボトルネックを解消すること。
  • 粒子フィルタリングサイクル中にCPU-GPU間のデータ転送を排除し、帯域幅制限を最小限に抑えること。
  • 正確かつ並列アーキテクチャ間で移植可能な完全並列リサンプリングアルゴリズムを開発すること。
  • GPUアクセラレーションを用いた順次CPUベースの粒子フィルタリングと比較して顕著な性能向上を示すこと。

提案手法

  • アルゴリズムは、すべての粒子フィルタリングステップ—尤度評価、CDF構築、リサンプリング、伝搬—をGPUデバイスメモリ内ですべて実行し、ホストCPUメモリへの転送を回避する。
  • リサンプリングには、累積分布関数(CDF)からの正確なサンプリングを並列に可能にするcut-point法を採用する。
  • デバイス固有のGPU機能を避けることで、マルチGPUまたはグリッドコンピューティングシステムへの移植性を確保する。
  • 選択インデックスを効率的に構築するために、並列プレフィックス和および排他的スキャン操作を用いてリサンプリングを実装する。
  • 大規模並列アーキテクチャ(GPGPUなど)における単一命令複数データ(SIMD)実行を想定して設計されている。
  • モンテカルロ実験により、単純な状態空間モデルにおいてGPU並列実装とCPU順次実装の実行時間を比較した。

実験結果

リサーチクエスチョン

  • RQ1CPU-GPU間のデータ転送を排除しつつ正確なリサンプリングを維持できる完全並列粒子フィルタリングアルゴリズムを設計できるか?
  • RQ2完全並列GPUベースの粒子フィルタの性能は、従来の順次CPUベースの実装と比べてどのように異なるか?
  • RQ3GPU環境下での全体実行時間に、CDF、伝搬、リサンプリングといった異なる計算ステップが及ぼす影響は何か?
  • RQ4提案されたアルゴリズムは、デバイス固有のGPU機能に依存せずに実装可能か?

主な発見

  • 提案されたGPUベースのアルゴリズムは、順次CPU実装と比較してCDF構築ステップで248倍の高速化を達成した。
  • 伝搬ステップでは45.3倍の高速化が得られ、GPUアーキテクチャにおける高い並列効率を示した。
  • リサンプリングステップでは11.9倍の高速化を達成し、ソーティングのオーバーヘッドを除いても2.7倍の向上を示し、CPU上でのストラティファイドリサンプリングを上回った。
  • GPUからCPUへのデータ転送(Storeステップ)は、全体実行時間の15–20%を占めており、メモリ転送がボトルネックであることを示している。
  • アルゴリズムの性能優位性は、粒子数が多く、時間窓が長い場合に顕著であり、初期化時間の影響は無視できるほど小さい。
  • この手法は完全に移植可能であり、アーキテクチャ依存性がないため、マルチGPUやグリッドコンピューティングシステムへの拡張が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。