Skip to main content
QUICK REVIEW

[論文レビュー] Comprehensive Evaluation of OpenCL-based Convolutional Neural Network Accelerators in Xilinx and Altera FPGAs

Ricardo Tapiador, Antonio Ríos-Navarro|arXiv (Cornell University)|Sep 29, 2016
Advanced Neural Network Applications参考文献 12被引用数 9
ひとこと要約

本稿では、5層のCNN向けにXilinxおよびAltera FPGAs上でOpenCLベースの畳み込みニューラルネットワーク(CNN)アクセラレータを評価し、ハードウェアリソース使用量、合成時間、実行性能、および設計の移植性を比較した。Xilinxはより速い合成時間と優れたリソース利用効率を示したが、Alteraは優れた実行時間、マルチプラットフォーム対応、成熟したツールチェーンを提供し、FPGAベースのディープラーニングアクセラレーションにおける効率性と性能のトレードオフを浮き彫りにした。

ABSTRACT

Deep learning has significantly advanced the state of the art in artificial intelligence, gaining wide popularity from both industry and academia. Special interest is around Convolutional Neural Networks (CNN), which take inspiration from the hierarchical structure of the visual cortex, to form deep layers of convolutional operations, along with fully connected classifiers. Hardware implementations of these deep CNN architectures are challenged with memory bottlenecks that require many convolution and fully-connected layers demanding large amount of communication for parallel computation. Multi-core CPU based solutions have demonstrated their inadequacy for this problem due to the memory wall and low parallelism. Many-core GPU architectures show superior performance but they consume high power and also have memory constraints due to inconsistencies between cache and main memory. FPGA design solutions are also actively being explored, which allow implementing the memory hierarchy using embedded BlockRAM. This boosts the parallel use of shared memory elements between multiple processing units, avoiding data replicability and inconsistencies. This makes FPGAs potentially powerful solutions for real-time classification of CNNs. Both Altera and Xilinx have adopted OpenCL co-design framework from GPU for FPGA designs as a pseudo-automatic development solution. In this paper, a comprehensive evaluation and comparison of Altera and Xilinx OpenCL frameworks for a 5-layer deep CNN is presented. Hardware resources, temporal performance and the OpenCL architecture for CNNs are discussed. Xilinx demonstrates faster synthesis, better FPGA resource utilization and more compact boards. Altera provides multi-platforms tools, mature design community and better execution times.

研究の動機と目的

  • リアルタイム推論を想定した、XilinxおよびAltera FPGAs上でのOpenCLベースCNNアクセラレータの評価と比較。
  • 両プラットフォーム間でのハードウェアリソース利用効率、合成時間、実行パフォーマンスの分析。
  • FPGAベースのディープラーニングワークロードにおけるOpenCLツールチェーンの成熟度と実用性の評価。
  • 設計生産性、パフォーマンス、リソース効率の観点から、プラットフォーム固有の利点の特定。

提案手法

  • XilinxおよびAltera FPGAsの両方で、OpenCLを用いて5層の畳み込みニューラルネットワークを実装。
  • FPGAに埋め込まれたBlockRAMを活用し、メモリ階層を最適化し、データ移動を削減。
  • 複数のFPGAボードを対象に、合成時間、リソース利用効率(LUT、BRAM、DSP)および実行遅延を評価。
  • XilinxおよびAlteraが提供するOpenCLフレームワークの比較を通し、コードの移植性とツールチェーンの成熟度に注目。
  • 同一のネットワークアーキテクチャおよび入力データのもとで、推論パフォーマンスをベンチマーク。
  • マルチプロセッサFPGA構成におけるメモリアクセスパターンおよび並列処理の効率性の分析。

実験結果

リサーチクエスチョン

  • RQ1XilinxおよびAlteraのOpenCLフレームワークは、CNNアクセラレーションにおいて合成時間およびリソース利用効率の観点でどのように比較できるか?
  • RQ25層のCNNに対して、XilinxおよびAltera FPGAsの間で推論実行時間にどのような差が生じるか?
  • RQ3両プラットフォームは、設計生産性、ツールチェーンの成熟度、利用可能な開発リソースの観点でどのように異なるか?
  • RQ4FPGA最適化されたメモリ階層は、両プラットフォームにおけるCNN推論効率をどの程度向上させるか?
  • RQ5リアルタイムCNN推論において、パフォーマンス、パワー効率、ハードウェアリソース使用量の観点で、どちらのプラットフォームがより良いトレードオフを提供するか?

主な発見

  • Xilinxは、より速い合成時間と優れたFPGAリソース利用効率を示し、同じ計算負荷に対してよりコンactで効率的なハードウェア実装が可能であった。
  • Alteraは、同じCNNワークロードに対してより短い実行時間を達成しており、推論スループットにおいて優れた性能を示した。
  • Alteraは成熟したツールチェーンと広範なマルチプラットフォーム対応を提供しており、開発の柔軟性とスケーラビリティを高めた。
  • 両プラットフォームとも、メモリバッファのボトルネックを低減し、CNN処理における並列性を向上させるために、埋め込みBlockRAMを効果的に活用した。
  • Xilinxボードはよりコンactであったため、同じ計算負荷に対して優れた面積効率を示した。
  • OpenCLベースのアプローチにより、両プラットフォーム間でのコードの移植性が実現したが、アーキテクチャおよびツールチェーンの差異により、パフォーマンスに顕著な差が生じた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。