[論文レビュー] Partial Order Pruning: for Best Speed/Accuracy Trade-off in Neural Architecture Search
本論文は、ネットワークの幅と深さに基づく部分順序仮定を用いて、探索空間を pruning することで、速度/精度のトレードオフを明示的に最適化するニューラルアーキテクチャ探索アルゴリズム「Partial Order Pruning」を提案する。本手法は、エンドデバイスおよびハイエンドGPUの両方で最先端の速度/精度性能を達成し、DF-Segネットワークは1080Tiで74.1% mIoUの精度を達成しながら106.4 FPSを実現し、TX2では720p解像度で21.8 FPSを達成した。
Achieving good speed and accuracy trade-off on a target platform is very important in deploying deep neural networks in real world scenarios. However, most existing automatic architecture search approaches only concentrate on high performance. In this work, we propose an algorithm that can offer better speed/accuracy trade-off of searched networks, which is termed "Partial Order Pruning". It prunes the architecture search space with a partial order assumption to automatically search for the architectures with the best speed and accuracy trade-off. Our algorithm explicitly takes profile information about the inference speed on the target platform into consideration. With the proposed algorithm, we present several Dongfeng (DF) networks that provide high accuracy and fast inference speed on various application GPU platforms. By further searching decoder architectures, our DF-Seg real-time segmentation networks yield state-of-the-art speed/accuracy trade-off on both the target embedded device and the high-end GPU.
研究の動機と目的
- 推論速度を重視せず、FLOPsを効率性の代理指標として用いる既存のニューラルアーキテクチャ探索手法のギャップを埋める。
- FLOPsや間接的指標ではなく、ターゲットプラットフォームでの実際の推論遅延を明示的に考慮する探索アルゴリズムを開発する。
- 同じ深さ・幅の制約下で、より幅が広いネットワークがより効率的でないことを仮定し、そのような非効率なアーキテクチャを早期にプルーニングすることで、より良い速度/精度トレードオフを達成する。
- リアルタイムセマンティックセグメンテーションに適した効率的で高精度なバックボーンおよびデコーダアーキテクチャを設計し、エンドデバイスおよびハイエンドGPUの両方で遅延を最小限に抑える。
提案手法
- Partial Order Pruning アルゴリズムは、部分順序仮定を用いる:同じ深さであれば、より幅の広いネットワークはより効率的ではないため、そのような広いバージョンは早期にプルーニングされる。
- 本手法は、ターゲットプラットフォームからの実際の推論速度測定値を探索プロセスに統合し、FLOPsに基づく推定を実際の遅延プロファイリングに置き換える。
- 勾配ベース最適化や強化学習、進化的戦略を回避するため、カットプレーンアルゴリズムを用いて残りの探索空間を効率的に探索する。
- バックボーンおよびデコーダアーキテクチャの両方を対象として探索が行われ、セグメンテーションタスクのエンドツーエンド最適化が可能になる。
- 本アルゴリズムは、特定のハードウェアプラットフォーム上で速度と精度を最適化したネットワークの集合(Dongfeng (DF) ネットワーク)を生成する。
- DF-Seg は、探索されたデコーダアーキテクチャと組み合わせたDFバックボーンの変種であり、高い効率性と精度を達成する。
実験結果
リサーチクエスチョン
- RQ1ターゲットハードウェアでの実際の推論遅延を明示的にモデル化することで、ニューラルアーキテクチャ探索アルゴリズムがより優れた速度/精度トレードオフを達成できるか?
- RQ2FLOPsが実世界のパフォーマンスの良い代理指標でない場合に、高品質なソリューションを維持しつつ、アーキテクチャ探索をどのように高速化できるか?
- RQ3幅と深さに関する部分順序仮定を用いて、探索プロセスの初期段階で非効率なアーキテクチャを効果的にプルーニングできるか?
- RQ4エンドデバイスおよびハイエンドGPUの両方で、リアルタイムセマンティックセグメンテーションの達成可能な速度/精度フロンティアはどの程度か?
主な発見
- GTX 1080Ti では、DF1-Seg ネットワークが 1024×2048 解像度で 74.1% mIoU の精度を達成しながら 106.4 FPS を実現し、BiSeNet1 や BiSeNet2 よりも速度と精度の両面で優れている。
- TX2 では、DF1-Seg ネットワークが 1280×720 解像度で 21.8 FPS を達成し、エンドデバイスでの強力なパフォーマンスを示している。
- DF1 ネットワークは、ResNet-18 と同等の ImageNet top-1 精度を達成しているが、43%の遅延低減(2.5ms 対 4.4ms)を実現している。
- DF1-Seg-d8 は、1/8 解像度で予測し、最近傍補間でアップサンプリングすることで、1080Ti で 136.9 FPS を達成し、テストセットで 71.4% mIoU を維持している。
- DF2-Seg2 は、Cityscapes 検証セットで 56.3 FPS で 76.9% の最高 mIoU を達成し、リアルタイムセグメンテーション分野で新たなSOTAを樹立した。
- ICNet と比較して、DF1-Seg は同等の推論速度でテストセットで 3.5% 高い mIoU を達成している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。