Skip to main content
QUICK REVIEW

[論文レビュー] An Area-Efficient FPGA Overlay using DSP Block based Time-multiplexed Functional Units

Xiangwei Li, Abhishek Kumar Jain|arXiv (Cornell University)|Jun 21, 2016
Embedded Systems Design Techniques参考文献 15被引用数 13
ひとこと要約

本稿では、複数のカーネル演算にわたる機能ユニットの共有を活用して面積オーバーヘッドを低減する、時間多重化されたDSPブロックベースのFPGAオーバーレイアーキテクチャを提案する。パイプライン化された、アーキテクチャに適応した機能ユニットを直線アレイに配置し、高速なコンテキストスイッチングを実現することで、FPGAリソース使用量を最大85%削減しながら、理論的動作周波数制限に近い性能を維持する。

ABSTRACT

Coarse grained overlay architectures improve FPGA design productivity by providing fast compilation and software-like programmability. Throughput oriented spatially configurable overlays typically suffer from area overheads due to the requirement of one functional unit for each compute kernel operation. Hence, these overlays have often been of limited size, supporting only relatively small compute kernels while consuming considerable FPGA resources. This paper examines the possibility of sharing the functional units among kernel operations for reducing area overheads. We propose a linear interconnected array of time-multiplexed FUs as an overlay architecture with reduced instruction storage and interconnect resource requirements, which uses a fully-pipelined, architecture-aware FU design supporting a fast context switching time. The results presented show a reduction of up to 85% in FPGA resource requirements compared to existing throughput oriented overlay architectures, with an operating frequency which approaches the theoretical limit for the FPGA device.

研究の動機と目的

  • 各カーネル演算毎に専用の機能ユニットを必要とするスループット指向のFPGAオーバーレイが引き起こす高い面積オーバーヘッドを低減すること。
  • 機能ユニットの共有を通じてリソース消費を最小限に抑えることで、FPGA上でのより大きな計算カーネルの実装を可能にすること。
  • 高速なコンテキストスイッチングと理論的動作周波数に近い周波数を確保することで、高いパフォーマンスを維持すること。
  • 既存のDSPブロックを活用した、スケーラブルで面積効率の良いオーバーレイアーキテクチャを設計すること。
  • 時間多重化された機能ユニットが、最小限のインターコネクトおよび命令記憶領域オーバーヘッドで高いスループットを達成できることを実証すること。

提案手法

  • オーバーレイは、複数のカーネル演算を処理する時間多重化された機能ユニット(FUs)の直線アレイを使用する。
  • 機能ユニットは、リソース効率を最大化し、高速動作を可能にするためにFPGAのDSPブロックを用いて実装される。
  • 完全にパイプライン化された設計により、処理遅延を最小限に抑えながら連続的なデータ処理が可能になる。
  • アーキテクチャに適応した制御論理により、モード切り替え時のオーバーヘッドを最小限に抑え、高速なコンテキストスイッチングが実現される。
  • インターコネクトは直線トポロジーを採用することで簡素化され、ルーティングおよび記憶要件が削減される。
  • FPGA固有のリソース(DSPブロック)を活用することで、面積を最小限に抑え、パフォーマンスを最大化する。

実験結果

リサーチクエスチョン

  • RQ1複数のカーネル演算にわたる機能ユニットの効果的な時間多重化は、スループットを損なわずに行えるか?
  • RQ2FPGAオーバーレイアーキテクチャにおいて、機能ユニットを共有することで、どの程度面積オーバーヘッドを低減できるか?
  • RQ3提案されたオーバーレイは、従来のスループット指向のオーバーレイと比較して、リソース使用量および動作周波数の点でどのように異なるか?
  • RQ4時間多重化アーキテクチャにおいて、高速なコンテキストスイッチングを達成できるか、パフォーマンスを維持できるか?
  • RQ5DSPベースの時間多重化オーバーレイにおいて、面積効率とパフォーマンスのトレードオフはどのようなものか?

主な発見

  • 提案されたオーバーレイは、従来のスループット指向のオーバーレイアーキテクチャと比較して、FPGAリソース要件を最大85%削減した。
  • 設計は、ターゲットFPGAデバイスの理論的最大周波数に近い動作周波数を達成した。
  • 時間多重化された機能ユニットアーキテクチャにより、複数のカーネル演算にわたるDSPブロックの効率的共有が可能になった。
  • アーキテクチャに適応した制御論理により高速なコンテキストスイッチングが実現され、パフォーマンスの低下が最小限に抑えられた。
  • 直線型インターコネクトトポロジーにより、インターコネクトおよび命令メモリリソース使用量が顕著に削減された。
  • リソース消費の低減により、従来の高コストな面積のオーバーレイよりも大きな計算カーネルの実装が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。