[論文レビュー] Ordering Chaos: Memory-Aware Scheduling of Irregularly Wired Neural Networks for Edge Devices
本稿では、メモリ制約のあるエッジデバイス上での不規則な接続構造を持つニューラルネットワーク向けに、メモリに配慮したスケジューリングフレームワークを提案する。動的計画法を用い、グラフシグネチャに基づく部分パス再利用と、適応的ソフトバジェットを組み合わせることで、ピークメモリ使用量を最小化する。TensorFlow Liteと比較して1.86倍低いメモリ使用量と1.76倍少ないオフチップトラフィックを達成し、コンパイル時間の追加が1分未塔である。
Recent advances demonstrate that irregularly wired neural networks from Neural Architecture Search (NAS) and Random Wiring can not only automate the design of deep neural networks but also emit models that outperform previous manual designs. These designs are especially effective while designing neural architectures under hard resource constraints (memory, MACs, . . . ) which highlights the importance of this class of designing neural networks. However, such a move creates complication in the previously streamlined pattern of execution. In fact one of the main challenges is that the order of such nodes in the neural network significantly effects the memory footprint of the intermediate activations. Current compilers do not schedule with regard to activation memory footprint that it significantly increases its peak compared to the optimum, rendering it not applicable for edge devices. To address this standing issue, we present a memory-aware compiler, dubbed SERENITY, that utilizes dynamic programming to find a sequence that finds a schedule with optimal memory footprint. Our solution also comprises of graph rewriting technique that allows further reduction beyond the optimum. As such, SERENITY achieves optimal peak memory, and the graph rewriting technique further improves this resulting in 1.68x improvement with dynamic programming-based scheduler and 1.86x with graph rewriting, against TensorFlow Lite with less than one minute overhead.
研究の動機と目的
- メモリ制約のあるエッジデバイスにデプロイされた不規則に接続されたニューラルネットワークにおける高いピークメモリ使用量の課題に対処すること。
- 非正則な接続性を持つ、高精度なNAS生成モデルをエッジハードウェアにデプロイ可能にする。
- 推論中の活性化メモリ使用量を最小限に抑えるスケーラブルなスケジューリングアルゴリズムの開発。
- 動的計画法と適応的バジェティングを用いて、探索空間の非効率性を克服すること。
- モデルの動作を変更せずにメモリ使用量をさらに削減するため、アイデンティティグラフリライトを導入すること。
提案手法
- 部分スケジュール内の繰り返し発生する部分パスに対して、グラフの性質を用いて一意なシグネチャを生成し、動的計画法に基づく最適化を可能にする。
- 部分パスのシグネチャに実行時のメモリ使用量を統合することで、メモリに配慮したスケジューリング意思決定を支援する。
- 軽量なメタサーチとしての適応的ソフトバジェティングを実装し、解の品質とコンパイル時間のバランスを取る最適なメモリバジェットを特定する。
- 適応的バジェティングに基づくプルーニングを用いた動的計画法により、最適性を損なわずに探索空間を縮小する。
- 数学的同等性を保持しながら、計算グラフを再構造化してより良いスケジューリング機会を露呈するアイデンティティグラフリライト技術を設計する。
- 動的計画法、適応的バジェティング、およびグラフリライトを統合したコンpilationパイプラインを、エッジデプロイメントに向け構築する。
実験結果
リサーチクエスチョン
- RQ1不規則に接続されたニューラルネットワークのスケジューリングに、動的計画法をどのように効果的に適用できるか?
- RQ2大規模グラフにおける指数的探索空間の課題を克服するため、どのような技術がスケジューリングの実行可能性を高められるか?
- RQ3適応的ソフトバジェティングは、実行可能な解を保証しつつ、コンパイル時間を過度に延長せずに最適に近いメモリバジェットを特定できるか?
- RQ4アイデンティティグラフリライトは、モデルの機能を変更せずに、どれほどピークメモリ使用量を削減できるか?
- RQ5TensorFlow Liteなどの既存フレームワークと比較して、提案手法はメモリ効率性とコンパイルオーバーヘッドの点でどの程度優れているか?
主な発見
- 提案フレームワークは、代表的な不規則ネットワーク全体で、TensorFlow Liteと比較してピークメモリ使用量を1.86倍削減した。
- オフチップメモリトラフィックは1.76倍削減され、エネルギー効率と帯域幅利用効率が向上した。
- 平均して1分未満の追加コンパイル時間で、実世界のデプロイメントに実用的であることが確認された。
- 適応的ソフトバジェティングは、非実行可能なスケジュールを避けるとともに、過度に長いコンパイル時間を引き起こさない近似的に最適なメモリバジェットを効果的に特定した。
- アイデンティティグラフリライトにより、より低いメモリ使用量を促進する計算グラフの再構造化が可能となり、追加のメモリ節約が達成された。
- 部分パスシグネチャ再利用と適応的バジェティングを組み合わせた動的計画法により、大規模で不規則なグラフにおいてもスケーラブルかつほぼ最適なスケジューリングが実現可能となった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。