[論文レビュー] MoGA: Searching Beyond MobileNetV3
MoGAは、モバイルGPU推論を特に最適化する最初のモバイルGPU対応ニューラルアーキテクチャ探索(NAS)フレームワークを提案する。重み付きフィットネス戦略を用い、パラメータ数よりも精度と遅延を優先する。わずか12 GPU日間で訓練が完了し、MnasNetの約200分の1のコストで、MoGA-A(ImageNetのトップ1精度75.9%)やMoGA-Cといったモデルを生成。これらは同程度のFLOPsとパラメータ数でMobileNetV3をGPUで上回る性能を発揮する。
The evolution of MobileNets has laid a solid foundation for neural network applications on mobile end. With the latest MobileNetV3, neural architecture search again claimed its supremacy in network design. Unfortunately, till today all mobile methods mainly focus on CPU latencies instead of GPU, the latter, however, is much preferred in practice for it has faster speed, lower overhead and less interference. Bearing the target hardware in mind, we propose the first Mobile GPU-Aware (MoGA) neural architecture search in order to be precisely tailored for real-world applications. Further, the ultimate objective to devise a mobile network lies in achieving better performance by maximizing the utilization of bounded resources. Urging higher capability while restraining time consumption is not reconcilable. We alleviate the tension by weighted evolution techniques. Moreover, we encourage increasing the number of parameters for higher representational power. With 200x fewer GPU days than MnasNet, we obtain a series of models that outperform MobileNetV3 under the similar latency constraints, i.e., MoGA-A achieves 75.9% top-1 accuracy on ImageNet, MoGA-B meets 75.5% which costs only 0.5 ms more on mobile GPU. MoGA-C best attests GPU-awareness by reaching 75.3% and being slower on CPU but faster on GPU.The models and test code is made available here https://github.com/xiaomi-automl/MoGA.
研究の動機と目的
- 実際のアプリケーションでより一般的に使われているGPU推論に焦点を移すことで、CPUに偏ったモバイルニューラルアーキテクチャ探索におけるギャップを埋める。
- 厳密な遅延およびリソース制約の中で、精度と遅延を最適化し、不足適合を防ぐために高いパラメータ数を許容することで、モデル性能を向上させる。
- ワンショットスーパーネットと遅延ルックアップテーブルを活用することで、複数のモバイルプラットフォームに効率的に適応可能な、NASの探索コストを著しく削減する。
- 再トレーニングなしに新しいデバイスに迅速に再構成可能な、一度のための(once-for-all)NASパイプラインを構築する。
提案手法
- モバイルGPU推論に特化した、GPU遅延を主たる最適化ターゲットとする、Mobile GPU-Aware NAS(MoGA)の導入。CPU中心の設計から脱却する。
- 精度、遅延、パラメータ数を組み合わせた重み付きフィットネス関数を採用。精度と遅延に高い重みを割り当て、パラメータ数の増加に対してボーナスを付与し、表現力の向上を促進する。
- メモリおよび計算コストを削減するため、単一路トレーニングを用いたワンショットスーパーネット訓練を採用。低コストで効率的なアーキテクチャ探索を実現。
- 探索中の遅延推定を効率的に行うために、正確な遅延ルックアップテーブルを構築。実デバイスの測定を避けることで、高コストな測定を回避する。
- 重み付きNSGA-IIアルゴリズムにおいて階層的ミューテーションを適用し、探索効率と収束性を向上。ランダムミューテーションベースラインを上回る性能を発揮。
- 探索とトレーニングを分離。同じスーパーネットを複数のモバイルプラットフォームで再利用可能であり、更新された遅延テーブルを用いた軽量な再探索のみで対応可能。
実験結果
リサーチクエスチョン
- RQ1実世界のデプロイでより一般的に使われているGPU推論を想定した場合、ニューラルアーキテクチャ探索を効果的にモバイルGPU推論に適応できるか?
- RQ2不足適合のリスクが過剰適合よりも高いモバイルNASにおいて、精度、遅延、パラメータ数のトレードオフをどのように最適化できるか?
- RQ3事前トレーニング済みスーパーネットと遅延ルックアップテーブルを再利用することで、新しいモバイルプラットフォームに対するNASの探索コストをほぼゼロにできるか?
- RQ4特にGPU上で、パラメータ数の増加が遅延を増加させずに性能向上に寄与するか?
- RQ5GPU対応アーキテクチャ探索は、CPU中心のアプローチと比較して、実世界の推論速度と精度の面でどのように差がでるか?
主な発見
- MoGA-Aは、MobileNetV3と同等の遅延制約下でImageNetで75.9%のトップ1精度を達成し、モバイルGPU上でそれを上回る性能を発揮する。
- MoGA-Bは、MoGA-Aに比べてわずか0.5 msの追加遅延で、75.5%のトップ1精度を達成する。
- MoGA-Cは、MobileNetV3と同一のFLOPsとパラメータ数を有するが、モバイルGPUでは速く、CPUでは遅いという特性を示し、GPU対応設計の有効性を裏付ける。
- MoGAの全探索パイプラインはわずか12 GPU日間で完了し、MnasNetの約200分の1のコストで、探索コストの顕著な削減を実現した。
- ワンショットスーパーネットと遅延ルックアップテーブルにより、効率的かつ一度のための展開が可能となり、新しいデバイスへの追加探索コストはo(1)にまで低下する。
- 重み付きNSGA-IIアルゴリズムにおける階層的ミューテーションは、探索効率を向上させ、ランダムミューテーションベースラインを上回るパラメータのパラトープフロントを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。