[論文レビュー] Pixie: A heterogeneous Virtual Coarse-Grained Reconfigurable Array for high performance image processing applications
本稿では、FPGA上に実装された異種型バーチャルコarse-Grained再構成可能アレイ(VCGRA)であるPixieを提案する。パラメータ化された設定フローを用いることで、処理要素に対して24%、仮想チャネルに対して82%の論理リソース削減を実現し、ハードDSPブロックに依存せずに高速なコンパイルと再構成を可能にするとともに、低コストFPGA上での柔軟な実装を実現する。
Coarse-Grained Reconfigurable Arrays (CGRAs) enable ease of programmability and result in low development costs. They enable the ease of use specifically in reconfigurable computing applications. The smaller cost of compilation and reduced reconfiguration overhead enables them to become attractive platforms for accelerating high-performance computing applications such as image processing. The CGRAs are ASICs and therefore, expensive to produce. However, Field Programmable Gate Arrays (FPGAs) are relatively cheaper for low volume products but they are not so easily programmable. We combine best of both worlds by implementing a Virtual Coarse-Grained Reconfigurable Array (VCGRA) on FPGA. VCGRAs are a trade off between FPGA with large routing overheads and ASICs. In this perspective we present a novel heterogeneous Virtual Coarse-Grained Reconfigurable Array (VCGRA) called "Pixie" which is suitable for implementing high performance image processing applications. The proposed VCGRA contains generic processing elements and virtual channels that are described using the Hardware Description Language VHDL. Both elements have been optimized by using the parameterized configuration tool flow and result in a resource reduction of 24% for each processing elements and 82% for each virtual channels respectively.
研究の動機と目的
- FPGA上での画像処理アクセラレータ開発のコストとコンパイル時間を低減すること。
- 高水準なアプリケーション記述とFPGA実装の間のギャップを埋めること。
- ハードコードされたDSPブロックに依存しない柔軟でパラメータ化可能なVCGRAを低価格FPGAに実装することで、その依存性を排除すること。
- Sobelエッジ検出などの画像処理ワークロードに対して、高い性能と低い面積オーバーヘッドを達成すること。
- パラメータ化された再構成を通じて、ASICに類似した効率性とFPGAに類似したプログラマビリティを実現できるかを示すこと。
提案手法
- VCGRAは、論理リソースとインターコネクトリソースの最適化を図るため、パラメータ化された設定ツールフローを用いてFPGA上に実装された。
- 処理要素(PE)は、算術演算(加算、減算、乗算など)を実行可能な設定可能な関数ユニットを備えており、機能の異種性を実現している。
- 仮想チャネル(VC)は、調整可能な接続(TCON)を用いて実装され、パラメータ化により最適化され、リソース使用量が82%削減された。
- 再構成可能なインターコネクトネットワークは、仮想スイッチブロック(VSB)と設定レジスタを用いて、データパスの動的再構成を可能にしている。
- IEEE 754準拠の浮動小数点演算を実現するため、FloPoCoを用いて固定小数点および浮動小数点PEバージョンが実装された。
- Sobelエッジ検出フィルタは45個のPEと4つのVCを用いてマッピングされ、再構成時間はPEで156 ms、VCで18.4 msであった。
実験結果
リサーチクエスチョン
- RQ1パラメータ化されたVCGRA実装は、FPGA上での画像処理アプリケーションにおけるリソース使用量と再構成オーバーヘッドを低減できるか?
- RQ2ハードコードされたDSPブロックに依存しないVCGRAは、従来のFPGA実装と比較して、面積とパフォーマンスの面でどのように異なるか?
- RQ3パラメータ化された設定は、処理要素および仮想チャネルにおける論理リソースと配線長のオーバーヘッドをどの程度低減できるか?
- RQ4パラメータ化は、実世界の画像処理カーネルにおけるコンパイル時間および再構成時間にどのような影響を与えるか?
- RQ5VCGRAは、FPGAレベルのプログラマビリティと低コスト開発を実現しながら、ASICに類似したパフォーマンスを達成できるか?
主な発見
- 提案されたVCGRAは、パラメータ化された設定により、処理要素で24%、仮想チャネルで82%の論理リソース削減を達成した。
- 最小チャネル幅が42%削減されたことにより、パラメータ化された実装では配線長が76%削減された。
- 固定小数点PEは、LUT使用量が5%削減され、配線長が2%削減され、再構成コストが3.4 msであった。
- 浮動小数点PEは、面積で24%、配線長で25%の最適化が達成され、再構成コストは88.5 msであった。
- 4×4 VCGRAグリッドでは、論理リソースが6%、配線長が4%削減され、再構成コストは98.5 msであった。
- Sobelフィルタのコンパイル時間は1秒未満であり、ビットストリーム生成には約1200秒を要した—これは従来のFPGAフローと比較して顕著に高速であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。