Skip to main content
QUICK REVIEW

[論文レビュー] Energy-Efficient Accelerator Design for Deformable Convolution Networks

Dawen Xu, Cheng Chu|arXiv (Cornell University)|Jul 6, 2021
Advanced Neural Network Applications参考文献 36被引用数 4
ひとこと要約

本論文は、実行時タイルベースの依存関係追跡とスケジューリングを導入することで、不規則なメモリアクセスを効率的に処理する専用のニューラルネットワークアクセラレータ(DCNA)を提案している。このアプローチにより、2次元配列上で並列な双線形補間(BLI)が可能となり、処理ステージの統合によってデータ移動を削減できる。DCNAはGPUに対して3倍の高速化と18.6倍のエネルギー効率向上を達成し、ARM+TPUに対しては45倍~546倍の高速化を実現。標準NNA上での面積オーバーヘッドはわずか6.6%にとどまる。

ABSTRACT

Deformable convolution networks (DCNs) proposed to address the image recognition with geometric or photometric variations typically involve deformable convolution that convolves on arbitrary locations of input features. The locations change with different inputs and induce considerable dynamic and irregular memory accesses which cannot be handled by classic neural network accelerators (NNAs). Moreover, bilinear interpolation (BLI) operation that is required to obtain deformed features in DCNs also cannot be deployed on existing NNAs directly. Although a general purposed processor (GPP) seated along with classic NNAs can process the deformable convolution, the processing on GPP can be extremely slow due to the lack of parallel computing capability. To address the problem, we develop a DCN accelerator on existing NNAs to support both the standard convolution and deformable convolution. Specifically, for the dynamic and irregular accesses in DCNs, we have both the input and output features divided into tiles and build a tile dependency table (TDT) to track the irregular tile dependency at runtime. With the TDT, we further develop an on-chip tile scheduler to handle the dynamic and irregular accesses efficiently. In addition, we propose a novel mapping strategy to enable parallel BLI processing on NNAs and apply layer fusion techniques for more energy-efficient DCN processing. According to our experiments, the proposed accelerator achieves orders of magnitude higher performance and energy efficiency compared to the typical computing architectures including ARM, ARM+TPU, and GPU with 6.6\% chip area penalty to a classic NNA.

研究の動機と目的

  • 従来のニューラルネットワークアクセラレータ(NNA)と互換性のない、可変畳み込みネットワーク(DCN)における不規則かつ動的なメモリアクセスパターンに対処する。
  • 既存のNNAが双線形補間(BLI)をネイティブにサポートしていないという課題を克服し、DCNにおける変形特徴の計算に不可欠なBLIを実現する。
  • モデルの再トレーニングや精度損失なしに、標準的および可変畳み込みを両方サポートするエネルギー効率の高いアクセラレータを設計する。
  • タイルベースのスケジューリングとレイヤーフュージョンにより、オンチップでのデータ再利用を可能にし、データ移動とメモリ帯域幅の圧力を低減する。
  • 既存のNNAアーキテクチャと互換性を保ちつつ、DCNにおいて高いパフォーマンスとエネルギー効率を実現する。

提案手法

  • 入力タイルと出力タイル間の実行時依存関係を追跡するためのタイル依存関係テーブル(TDT)を導入し、可変畳み込みにおける不規則なメモリアクセスを動的に処理可能にする。
  • TDTを活用して入力タイルの再利用を分析することで、データ再利用を最適化し、重複するメモリアクセスを削減するオンチップタイルスケジューラを開発する。
  • 2次元プロセッシングアレイに双線形補間(BLI)演算をマッピングする新しい戦略を提案し、一般用途プロセッサに依存せずに並列実行を実現する。
  • 各可変畳み込み演算内の処理ステージを統合するレイヤーフュージョン技術を適用し、DRAMへの中間データ移動を削減し、オンチップデータ再利用を向上させる。
  • タイルベースのデータパーティショニングを用いて計算とメモリアクセスを分離し、効率的なスケジューリングとバッファリングを可能にするとともに、DRAMのエネルギー消費を最小限に抑える。
  • 依存関係追跡の粒度とメモリアクセス効率のバランスを最適化するため、タイルサイズを最適化する。小さなタイルサイズは、より高い最適化可能性を提供する。

実験結果

リサーチクエスチョン

  • RQ1可変畳み込みネットワークにおける不規則かつ動的なメモリアクセスパターンを、ハードウェアアクセラレータで効率的に管理する方法は何か?
  • RQ2一般用途プロセッサに依存せずに、ニューラルネットワークアクセラレータ上で双線形補間演算を並列実行する有効なマッピング手法は何か?
  • RQ3タイル間でのデータ再利用を最大限に高めるには、DCNにおけるメモリ帯域幅とDRAMエネルギー消費をどのように低減できるか?
  • RQ4最小限の面積オーバーヘッドで標準NNAに可変畳み込みサポートを統合した場合、パフォーマンスとエネルギー効率はどの程度向上できるか?
  • RQ5レイヤーフュージョンとタイルベーススケジューリングを併用することで、中間データ移動を低減し、DCNワークロードにおけるアクセラレータ効率を向上させられるか?

主な発見

  • 提案されたDCNAは、可変畳み込みを非効率な一般用途プロセッサにオフロードするARM+TPUアーキテクチャと比較して、45倍~546倍の高いパフォーマンスを達成した。
  • 代表的なDCNモデル(VGG19およびSegNet-F)において、GPUと比較してDCNAは3倍の高速化と18.6倍のエネルギー効率向上を実現した。
  • タイルスケジューリング機構により、ビットベクトル依存関係追跡のみを用いたベースラインと比較して、平均で40.7%のメモリアクセス削減が達成された。
  • 小さなタイルサイズ(例:8×8)は、より良い依存関係追跡とデータ再利用により、最小の正規化されたDRAMエネルギー消費を実現した。
  • レイヤーフュージョンにより、VGG19/SegNet-Fでは20%以上のエネルギー消費削減が達成され、特に大規模な可変畳み込み演算において、DRAMへの中間データ転送を最小限に抑える効果が顕著であった。
  • DCNAはベースラインNNA比でわずか6.6%のチップ面積ペナルティにとどまり、DCNアクセラレーションを実現するにあたり、非常に高い面積効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。