[論文レビュー] ContextNet: Exploring Context and Detail for Semantic Segmentation in Real-time
ContextNet は低解像度のコンテキストのブランチと高解像度のディテールのブランチを組み合わせ、低メモリでリアルタイムのセマンティックセグメンテーションを実現します; Cityscapes のフル解像度画像で 18.3 fps、mIoU 66.1% を達成します。
Modern deep learning architectures produce highly accurate results on many challenging semantic segmentation datasets. State-of-the-art methods are, however, not directly transferable to real-time applications or embedded devices, since naive adaptation of such systems to reduce computational cost (speed, memory and energy) causes a significant drop in accuracy. We propose ContextNet, a new deep neural network architecture which builds on factorized convolution, network compression and pyramid representation to produce competitive semantic segmentation in real-time with low memory requirement. ContextNet combines a deep network branch at low resolution that captures global context information efficiently with a shallow branch that focuses on high-resolution segmentation details. We analyse our network in a thorough ablation study and present results on the Cityscapes dataset, achieving 66.1% accuracy at 18.3 frames per second at full (1024x2048) resolution (41.9 fps with pipelined computations for streamed data).
研究の動機と目的
- 自動運転や組み込みデバイス向けに、低メモリフットプリントでリアルタイムのセマンティックセグメンテーションを動機づける。
- ダウンサンプリングされたブランチからのグローバルコンテキストと、高解像度の局所的ディテールを統合する ContextNet アーキテクチャを提案する。
- Cityscapes データセットで、詳細なアブレーションを伴ってアプローチを評価する。
- 深さ方向分離畳み込みとプルーニングが、効率的で高精度な性能を実現することを示す。
提案手法
- グローバルコンテキストのための低解像度の深いブランチと、ディテールの洗練のための高解像度の浅いブランチを備えた二分岐アーキテクチャ。
- パラメータと計算量を削減するために、深さ方向分離畳み込みとボトルネック残差ブロックを使用。
- 特徴量を加算して最終予測の1x1畳み込みを適用する融合ユニットを介してブランチを融合。
- グローバルコンテキスト特徴を意味のあるものに促すため、低解像度ブランチに補助損失を適用。
- 標準的なデータ拡張と RMSprop 最適化で学習;低精度設定での堅牢性のためにバッチ正規化と ReLU6 を使用。
- 学習後にネットワークをプルーニングして、より小さく高速なバリアントを探索する( lottery-ticket 風のプルーニング)。
実験結果
リサーチクエスチョン
- RQ1低解像度でグローバルコンテキストを捉え、フル解像度で局所的ディテールを捉える二分岐ネットワークは、大幅な精度低下なしにリアルタイムのセマンティックセグメンテーションを達成できるのか?
- RQ2深さ方向分離畳み込みとボトルネックブロックは、Cityscapes規模のデータで精度、速度、メモリにどのような影響を与えるのか?
- RQ3組み込み/リアルタイム環境における ContextNet の mIoU と実行時間に対するネットワークプルーニングの影響は何か?
主な発見
- ContextNet は pruning 後、Cityscapes テストセットで 66.1% mIoU を達成。
- pruning なしで、1024×2048 の画像を単一 CPU スレッド(Titan X 測定)で 18.3 fps、64.2% mIoU を達成。
- 低解像度の深いコンテキストブランチと高解像度の浅いディテールブランチを備えた二分岐設計が、精度とリアルタイム性能のバランスを取る。
- プルーニングは Cityscapes テストセットの mIoU を 64.2% から 66.1% に向上させる。
- ContextNet はフル解像度で 18.3 fps、パイプライン化データを最適化した設定で 41.9 fps に到達できる。
- いくつかのリアルタイム競合と比較して、ContextNet は競争力のある精度と低いメモリフットプリントを提供する(ベース変種のパラメータは 0.85M)。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。