[論文レビュー] AXNet: ApproXimate computing using an end-to-end trainable neural network
AXNetは、ハダマード積による融合を用いたマルチタスク学習により、近似器と予測器を1つのアーキテクチャに統合したエンドツーエンドでトレーニング可能なニューラルネットワークを提案する。従来の反復的トレーニング手法と比較して、50.7%高い呼び出し率と最大90%のトレーニング時間短縮を達成し、高い近似品質とエネルギー効率を維持する。
Neural network based approximate computing is a universal architecture promising to gain tremendous energy-efficiency for many error resilient applications. To guarantee the approximation quality, existing works deploy two neural networks (NNs), e.g., an approximator and a predictor. The approximator provides the approximate results, while the predictor predicts whether the input data is safe to approximate with the given quality requirement. However, it is non-trivial and time-consuming to make these two neural network coordinate---they have different optimization objectives---by training them separately. This paper proposes a novel neural network structure---AXNet---to fuse two NNs to a holistic end-to-end trainable NN. Leveraging the philosophy of multi-task learning, AXNet can tremendously improve the invocation (proportion of safe-to-approximate samples) and reduce the approximation error. The training effort also decrease significantly. Experiment results show 50.7% more invocation and substantial cuts of training time when compared to existing neural network based approximate computing framework.
研究の動機と目的
- 既存の近似計算フレームワークにおける分離された近似器と予測器のニューラルネットワーク間の非効率さと最適でない連携を解消すること。
- 近似器と予測器を1つの共同トレーニング可能なネットワークに統合することで、トレーニング時間とモデルの複雑さを低減すること。
- 共同最適化により、近似品質の制御と呼び出し率(安全に近似可能な入力の割合)を向上させること。
- 最小限のハードウェアオーバーヘッドでNPUアーキテクチャへの効率的なデプロイを可能にすること。
- 反復的トレーニングや重み共有手法を凌駕する、新しいスケーラブルな統合メカニズムを提供すること。
提案手法
- AXNetは、共有コントロールベクトルと隠れ層重みの間でハダマード積を用いて近似器と予測器を統合し、共同最適化を可能にする。
- ネットワークは共有バックボーン構造を採用しており、予測ヘッドは近似器の隠れ層から、学習可能なコントロールベクトルとの要素ごとの乗算によって導出される。
- 標準的な誤差逆伝播法を用いたトレーニングで、回帰損失(近似精度)と分類損失(予測の信頼性)を組み合わせたマルチタスク損失関数が使用される。
- 統合メカニズムにより、アーキテクチャ的制約なしにパラメータ共有が可能となり、冗長性とモデルサイズが低減される。
- コスト効率の高いNPUデプロイ戦略が提案され、処理素子に近似サブネットユニットを追加するだけで、最小限のハードウェアコストで実現可能である。
- スケーラビリティとパフォーマンスの評価のため、ベッセル、FFT、JPEG、ソーベル関数を含む複数のベンチマークで評価が実施された。
実験結果
リサーチクエスチョン
- RQ1分離されたトレーニングとは対照的に、統一されたニューラルネットワークアーキテクチャが、近似精度と安全な近似入力の予測を共同で最適化する上で、より効果的であるか?
- RQ2共同損失関数を用いたエンドツーエンドトレーニングは、反復的トレーニングと比較して、トレーニング時間を短縮し、呼び出し率を向上させるか?
- RQ3提案された統合メカニズムは、モデルパラメータ数をどれほど低減し、近似品質を維持または向上させるか?
- RQ4AXNetは、異なるニューラルネットワークトポロジーとベンチマーク関数に対してどのようにスケーリングするか?
- RQ5AXNetは、最小限のハードウェア変更で実際のNPUに効率的にデプロイ可能であり、顕著なエネルギー効率の向上を達成できるか?
主な発見
- AXNetは反復的トレーニング手法と比較して50.7%高い呼び出し率を達成し、安全に近似可能な入力の割合が著しく高いことを示している。
- 反復的トレーニングと比較して、トレーニング時間が最大90%短縮され、ベッセルとJPEGベンチマークではそれぞれ13.8倍および32倍の高速化が観察された。
- JPEGベンチマークにおいて、従来手法と比較して60%のパラメータ数削減を達成しながら、同等の真の呼び出しレベルを維持した。
- ハダマード積を用いた統合手法は、統合位置(第1隠れ層 vs. 第2隠れ層)にかかわらず顕著な性能差を示さず、そのロバストネスが裏付けられた。
- すべてのベンチマークでエネルギー効率が向上し、高い呼び出し率と低いトレーニングコストのおかげで、AXNetは反復的およびワンパス手法を上回った。
- 提案されたNPUデプロイは最小限のハードウェアオーバーヘッドであり、各処理素子に近似サブネットを追加するだけで実現可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。