[論文レビュー] Accelerating Fully Connected Neural Network on Optical Network-on-Chip (ONoC)
この論文は、前向き伝搬および逆誤差誤差伝搬段階におけるコア割り当ての最適化により、光ネットワークオンチップ(ONoC)上で完全接続ニューラルネットワーク(FCNN)の学習を高速化する細分化された並列計算モデルを提案する。学習時間を最小化するための各段階における最適コア数を導出し、3つのマッピング戦略を評価した結果、バッチサイズ64において、ENoCと比較して最大22.28%の学習時間短縮と47.85%のエネルギー節約を達成した。
Fully Connected Neural Network (FCNN) is a class of Artificial Neural Networks widely used in computer science and engineering, whereas the training process can take a long time with large datasets in existing many-core systems. Optical Network-on-Chip (ONoC), an emerging chip-scale optical interconnection technology, has great potential to accelerate the training of FCNN with low transmission delay, low power consumption, and high throughput. However, existing methods based on Electrical Network-on-Chip (ENoC) cannot fit in ONoC because of the unique properties of ONoC. In this paper, we propose a fine-grained parallel computing model for accelerating FCNN training on ONoC and derive the optimal number of cores for each execution stage with the objective of minimizing the total amount of time to complete one epoch of FCNN training. To allocate the optimal number of cores for each execution stage, we present three mapping strategies and compare their advantages and disadvantages in terms of hotspot level, memory requirement, and state transitions. Simulation results show that the average prediction error for the optimal number of cores in NN benchmarks is within 2.3%. We further carry out extensive simulations which demonstrate that FCNN training time can be reduced by 22.28% and 4.91% on average using our proposed scheme, compared with traditional parallel computing methods that either allocate a fixed number of cores or allocate as many cores as possible, respectively. Compared with ENoC, simulation results show that under batch sizes of 64 and 128, on average ONoC can achieve 21.02% and 12.95% on reducing training time with 47.85% and 39.27% on saving energy, respectively.
研究の動機と目的
- ONoCの低遅延・高スループット光インタコネクトを活用して、多数コアシステムにおけるFCNN学習の通信ボトルネックを解消すること。
- ONoCにおけるFCNN学習の計算と通信のバランスを取る細分化された並列計算モデルを構築すること。
- 全学習時間の最小化を目的とした、前向き伝搬および逆誤差誤差伝搬段階における最適コア数を導出すること。
- ホットスポットレベル、メモリ要件、ステート遷移を考慮した3つのコアマッピング戦略(FM、RRM、ORRM)を提案・評価すること。
- 従来のENoCベースの並列計算手法と比較して、顕著な性能およびエネルギー効率の向上を実証すること。
提案手法
- ONoCにおけるFCNN学習の計算および通信コストを特徴付ける細分化された並列計算モデルを提案し、計算と通信のトレードオフ分析を可能にする。
- 遅延および帯域幅モデルに基づいて、全学習時間を最小化するための前向き伝搬および逆誤差誤差伝搬段階における最適コア数の解析的表現を導出する。
- ホットスポット、メモリ使用量、ステート遷移のトレードオフが異なる3つのコアマッピング戦略を設計:固定マッピング(FM)、行再利用マッピング(RRM)、最適化行再利用マッピング(ORRM)。
- 波長分割多重(WDM)を用いて波導内で複数波長の同時光通信を実現し、ONoCの高帯域幅および低遅延特性を活用する。
- SRAMに分散保存されるニューラルネットワークパラメータ(重みおよび部分和)に基づいて、1コアあたりのメモリ要件をモデル化する。
- NNベンチマークを用いた広範なシミュレーションを実施し、コア割り当て予測の妥当性を検証するとともに、固定コア数および完全並列化されたENoCベース手法と性能を比較した。
実験結果
リサーチクエスチョン
- RQ1FCNN学習におけるONoC上での各実行段階(前向き伝搬および逆誤差誤差伝搬)に最適なコア数は何か? これは全学習時間を最小化するためのものである。
- RQ2異なるコアマッピング戦略(FM、RRM、ORRM)は、ホットスポットレベル、メモリ要件、ステート遷移の観点でどのように比較されるか?
- RQ3提案されたモデルは、多様なニューラルネットワークベンチマークにおいて、低誤差で最適コア割り当てを正確に予測できるか?
- RQ4バッチサイズおよびコア数が変化する条件下で、ENoCと比較してONoCはFCNNの学習時間およびエネルギー消費量をどの程度削減できるか?
主な発見
- NNベンチマーク全体にわたる最適コア数の予測誤差平均は2.3%以内であり、提案された解析的モデルの正確性が裏付けられた。
- 提案手法は、固定コア数を割り当てる従来手法と比較して、平均で22.28%のFCNN学習時間短縮を達成した。
- 可能な限り多くのコアを割り当てる手法と比較して、平均で4.91%の学習時間短縮を達成した。
- バッチサイズ64および128の条件下で、ENoCと比較してONoCはそれぞれ21.02%および12.95%の学習時間短縮を達成した。
- バッチサイズ64および128の条件下で、ENoCと比較してONoCはエネルギー消費量を平均で47.85%および39.27%削減した。
- ORRMマッピング戦略はホットスポットレベル、メモリ使用量、ステート遷移のバランスが最も良く、FMおよびRRMを総合的に上回る効率性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。