Skip to main content
QUICK REVIEW

[論文レビュー] Device-Circuit-Architecture Co-Exploration for Computing-in-Memory Neural Accelerators

Weiwen Jiang, Qiuwen Lou|arXiv (Cornell University)|Oct 31, 2019
Advanced Memory and Neural Computing参考文献 47被引用数 4
ひとこと要約

本稿では、デバイスのばらつきを考慮した計算記憶統合(CiM)ニューラルアクセラレータのためのクロスレイヤー共同最適化フレームワークNACIMを提案する。NACIMは、デバイスタイプ、回路トポロジ、ニューラルアーキテクチャを同時に最適化し、デバイスのばらつきを反映した訓練と多目的最適化を統合することで、ばらつき下での精度損失を0.45%に抑える。これは最先端のNASの76.44%の損失と比較して顕著に優れている。また、16.3 TOPs/Wのエネルギー効率を達成し、先行研究比3.17倍の向上を実現した。

ABSTRACT

Co-exploration of neural architectures and hardware design is promising to simultaneously optimize network accuracy and hardware efficiency. However, state-of-the-art neural architecture search algorithms for the co-exploration are dedicated for the conventional von-neumann computing architecture, whose performance is heavily limited by the well-known memory wall. In this paper, we are the first to bring the computing-in-memory architecture, which can easily transcend the memory wall, to interplay with the neural architecture search, aiming to find the most efficient neural architectures with high network accuracy and maximized hardware efficiency. Such a novel combination makes opportunities to boost performance, but also brings a bunch of challenges. The design space spans across multiple layers from device type, circuit topology to neural architecture. In addition, the performance may degrade in the presence of device variation. To address these challenges, we propose a cross-layer exploration framework, namely NACIM, which jointly explores device, circuit and architecture design space and takes device variation into consideration to find the most robust neural architectures. Experimental results demonstrate that NACIM can find the robust neural network with 0.45% accuracy loss in the presence of device variation, compared with a 76.44% loss from the state-of-the-art NAS without consideration of variation; in addition, NACIM achieves an energy efficiency up to 16.3 TOPs/W, 3.17X higher than the state-of-the-art NAS.

研究の動機と目的

  • バーナウムアーキテクチャの性能ボトルネックを解消するため、メモリウォールを克服する計算記憶統合(CiM)を活用すること。
  • 最大のハードウェア効率とネットワーク精度を実現するため、デバイス、回路、ニューラルアーキテクチャ設計レイヤーの共同最適化を可能にすること。
  • 新興の不揮発性メモリデバイスにおけるデバイスのばらつきがニューラルネットワーク推論精度に与える影響を軽減すること。
  • 精度、エネルギー、遅延、面積、ハードウェア寿命を同時に最適化するスケーラブルな多目的共同探索フレームワークの開発。
  • ばらつきに配慮した訓練を伴うアーキテクチャ探索が、固定アーキテクチャ手法よりもはるかに堅牢で効率的なニューラルアクセラレータを実現できることを示すこと。

提案手法

  • NACIMは、デバイスタイプ、回路トポロジ、ニューラルアーキテクチャ設計空間を同時に探索する多目的強化学習フレームワークを採用する。
  • バックプロパゲーション中にデバイスの非理想性をシミュレートするばらつきに配慮した訓練手順を統合し、耐性性を向上させる。
  • 遅延、面積、エネルギーを重み付けした正規化されたハードウェア効率と推論精度を組み合わせた報酬関数を用いる。
  • モンテカルロサンプリングを用いて、トレーニング中にデバイスのばらつきの影響を推定し、デバイスパrameter分布全体にわたる耐性性を確保する。
  • 探索可能な設計空間には、VGG-11、ResNetに類似した構造、U-Netスタイルのエンコーダーを含む多様なニューラルアーキテクチャが含まれており、効率的でタスク固有の設計の探索を可能にする。
  • EDPや面積といったハードウェア指標を正規化し、ハードウェア効率の目的関数に組み込むことで、パレート最適なトレードオフを実現する。

実験結果

リサーチクエスチョン

  • RQ1CiMアクセラレータにおいて、デバイス、回路、ニューラルアーキテクチャ設計空間の共同探索は、従来のNASよりも優れた精度とハードウェア効率を達成できるか?
  • RQ2デバイスのばらつきは、CiMハードウェアにマッピングされたニューラルネットワークの推論精度にどのように影響を及ぼすか?また、トレーニング段階でこれを軽減できるか?
  • RQ3非理想デバイス動作下で、アーキテクチャ探索がCiMベースのニューラルアクセラレータの堅牢性と効率に与える影響は何か?
  • RQ4統合されたフレームワークは、CiMアクセラレータにおいて精度、エネルギー、遅延、面積、ハードウェア寿命を同時に最適化できるか?
  • RQ5提案されたNACIMフレームワークは、異なるバックボーンアーキテクチャや機械学習タスクにスケーリング可能か?

主な発見

  • NACIMは16.3 TOPs/Wのエネルギー効率を達成し、最先端のNAS手法比3.17倍の向上を示した。
  • デバイスのばらつき下でも、NACIMはわずか0.45%の精度損失に抑えられた。これに対して、ばらつきを無視したNASでは76.44%の損失を示しており、NACIMの優れた耐性性が裏付けられた。
  • ResNetに類似したバックボーンを用いたCIFAR-10では、NACIMはベースラインの72.18%から73.45%へ精度を向上させ、面積を23.3%削減し、EDPを52.4%低減した。
  • VLSオブジェクトセグメンテーションタスクでは、NACIMは93.12%の精度を達成し、面積4.75×10⁸ μm²、EDP 5.54×10¹⁵ pJ·nsを実現し、精度と効率の両面でベースラインを上回った。
  • フレームワークは、VGG-11のような大規模バックボーンよりも高い精度と低いEDPを達成する、より小型で効率的なアーキテクチャ(例:RLS)を効果的に同定した。
  • ばらつきに配慮した訓練は、推論の耐性性を顕著に向上させ、RLS、VLS、EDSタスクにおいて、それぞれ9.8%、9.6%、0.525 IOUの精度向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。