[論文レビュー] NAX: Co-Designing Neural Network and Hardware Architecture for Memristive Xbar based Computing Systems
NAX は、深層畳み込みニューラルネットワークとメモリストリプルクロスバー型インメモリコンピューティング(IMC)ハードウェアを共同で最適化するニューラルアーキテクチャ探索(NAS)フレームワークであり、精度とハードウェア効率のバランスをとるために、カーネルサイズとクロスバー寸法を同時に最適化する。CIFAR-10 ではベースラインのResNetモデルと比較して17%低いEDAP、0.8%高い精度を達成し、Tiny ImageNet では4%低いEDAP、0.2%高い精度を達成した。
In-Memory Computing (IMC) hardware using Memristive Crossbar Arrays (MCAs) are gaining popularity to accelerate Deep Neural Networks (DNNs) since it alleviates the "memory wall" problem associated with von-Neumann architecture. The hardware efficiency (energy, latency and area) as well as application accuracy (considering device and circuit non-idealities) of DNNs mapped to such hardware are co-dependent on network parameters, such as kernel size, depth etc. and hardware architecture parameters such as crossbar size. However, co-optimization of both network and hardware parameters presents a challenging search space comprising of different kernel sizes mapped to varying crossbar sizes. To that effect, we propose NAX -- an efficient neural architecture search engine that co-designs neural network and IMC based hardware architecture. NAX explores the aforementioned search space to determine kernel and corresponding crossbar sizes for each DNN layer to achieve optimal tradeoffs between hardware efficiency and application accuracy. Our results from NAX show that the networks have heterogeneous crossbar sizes across different network layers, and achieves optimal hardware efficiency and accuracy considering the non-idealities in crossbars. On CIFAR-10 and Tiny ImageNet, our models achieve 0.8%, 0.2% higher accuracy, and 17%, 4% lower EDAP (energy-delay-area product) compared to a baseline ResNet-20 and ResNet-18 models, respectively.
研究の動機と目的
- メモリスティブクロスバー型インメモリコンピューティング(IMC)システムにおいて、DNNモデルのパラメータ(例:カーネルサイズ、深さ)とハードウェアパラメータ(例:クロスバーサイズ)の相乗的依存関係に対処すること。
- メモリスティブクロスバーにおけるデバイスおよび回路の非理想性が原因で生じる、ハードウェア効率(エネルギー、遅延、面積)とモデル精度のトレードオフを克服すること。
- DNNアーキテクチャとIMCハードウェア設定を共同最適化するNASフレームワークを構築し、非理想状態下でも最適なパフォーマンスを達成すること。
- ネットワーク層ごとに異なったクロスバーサイズを採用することで、アナログIMCシステムにおけるハードウェア効率と推論精度の両方を向上させられることを実証すること。
提案手法
- 各DNN層に対して、変動するカーネルサイズ(例:3x3, 5x5)を異なるクロスバーサイズ(例:64x64, 128x128)にマッピングする共同設計の探索空間を提案する。
- ナノスケールの非理想性(寄生抵抗、アセストランジスタ由来の非線形性、I-V非理想性)をNAS中の精度推定段階に統合する。
- 複数のカーネルサイズおよびクロスバーサイズオプションを備えた混合層を含むスーパーネットを用いた、微分可能アーキテクチャ探索(DARTS風)アプローチを採用する。
- 非理想性を無視する i-search と、非理想性を含む ni-search の2段階探索を実施し、現実的なハードウェア制約下での精度を評価する。
- アーキテクチャパラメータの更新時に非理想性の影響を推定するために GENIEx 推論を活用し、精度に配慮した探索を向上させる。
- 学習率スケジューリングを用いたAdam最適化手法でアーキテクチャパラメータを学習し、最終的なコンパクトなネットワークをテストセットで検証する。
実験結果
リサーチクエスチョン
- RQ1クロスバーサイズは、メモリスティブクロスバー型IMCシステムにマッピングされたDNNのハードウェア効率(EDAP)と精度にどのように影響するか?
- RQ2デバイスおよび回路の非理想性を考慮した上で、DNNアーキテクチャとクロスバーサイズを共同最適化する際の、ハードウェア効率とモデル精度の最適なトレードオフは何か?
- RQ3DNNとハードウェアパラメータを共同で探索するNASフレームワークは、固定されたハードウェア構成にマッピングされた従来のDNNに比べ、EDAPと精度の両面で優れているか?
- RQ4より大きなクロスバーにおける非理想性は推論精度にどのように影響するか? また、各層ごとのインtelリジェントなクロスバーサイズ選択によってその影響を軽減できるか?
- RQ5探索プロセス中に非理想性を考慮することで、実際のIMCハードウェア上で動作する最終モデルの精度はどの程度向上するか?
主な発見
- NAX は、メモリスティブクロスバー型ハードウェアにマッピングした際、ベースラインのResNet-20モデルと比較してCIFAR-10で17%低いEDAP、0.8%高い精度を達成した。
- Tiny ImageNet では、同じハードウェア制約下でベースラインのResNet-18モデルと比較して、4%低いEDAP、0.2%高い精度を達成した。
- 最適なクロスバーサイズは層ごとに異なる:出力チャネル数が128を超える場合、未利用のままになるのを避けるために大きなクロスバー(例:128x128)が使用され、小規模な演算には小さなクロスバー(例:64x64)が好まれる。
- 非理想性を探索段階で考慮する ni-search は、非理想性を無視する i-search よりも顕著に高い精度を示し、特にTiny ImageNetでは、最高性能のモデルで18.57%の精度差が生じた。
- ni-search の探索コストは i-search よりも高い(Tiny ImageNetで350 GPU時間)が、得られるモデルは優れた精度とハードウェア効率を示した。
- 結果から、層ごとに異なるクロスバーサイズを採用することが、ハードウェア効率と精度の両立に不可欠であることが示された。128x128クロスバーは高チャネル演算に最適であり、64x64は小規模な演算に適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。