Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Dilated Convolution for Real-time Semantic Segmentation

Roland Gao|arXiv (Cornell University)|Nov 18, 2021
Advanced Neural Network Applications参考文献 47被引用数 9
ひとこと要約

本稿では、バックボーン全体に大規模で調整可能な拡張率を持つ拡張畳み込みを用いて従来のダウンサンプリングを置き換えることで、大きな制御可能受容 field を実現するリアルタイム意味セグメンテーションモデル RegSeg を提案する。新しい D ブロックを導入し、並列な拡張畳み込みと微分可能アーキテクチャ探索により最適な拡張率を特定することで、ImageNet プリトレーニングなしで Cityscapes および CamVid で最先端の精度-効率トレードオフを達成し、テストセットでは 37 FPS で 78.3 mIOU、112 FPS で 80.9 mIOU を達成した。

ABSTRACT

The field-of-view is an important metric when designing a model for semantic segmentation. To obtain a large field-of-view, previous approaches generally choose to rapidly downsample the resolution, usually with average poolings or stride 2 convolutions. We take a different approach by using dilated convolutions with large dilation rates throughout the backbone, allowing the backbone to easily tune its field-of-view by adjusting its dilation rates, and show that it's competitive with existing approaches. To effectively use the dilated convolution, we show a simple upper bound on the dilation rate in order to not leave gaps in between the convolutional weights, and design an SE-ResNeXt inspired block structure that uses two parallel $3 imes 3$ convolutions with different dilation rates to preserve the local details. Manually tuning the dilation rates for every block can be difficult, so we also introduce a differentiable neural architecture search method that uses gradient descent to optimize the dilation rates. In addition, we propose a lightweight decoder that restores local information better than common alternatives. To demonstrate the effectiveness of our approach, our model RegSeg achieves competitive results on real-time Cityscapes and CamVid datasets. Using a T4 GPU with mixed precision, RegSeg achieves 78.3 mIOU on Cityscapes test set at $37$ FPS, and 80.9 mIOU on CamVid test set at $112$ FPS, both without ImageNet pretraining.

研究の動機と目的

  • リアルタイム意味セグメンテーションモデルにおける受容 field の小さな制限を解消するため、バックボーン全体で標準的なダウンサンプリングを拡張畳み込みに置き換えること。
  • 拡張率を調整することで、特徴マップのカバー範囲にギャップがないように、視野を正確に制御すること。
  • 異なる拡張率を用いた二重パスの拡張畳み込みブロック(D ブロック)を採用することで、高解像度特徴量におけるローカルディテールを保持すること。
  • 微分可能可変畳み込みを用いて、拡張率の最適化を勾配ベースで行えるように、微分可能ニューラルアーキテクチャ探索を適用すること。
  • 特徴抽象化の過程で失われた空間的ディテールを効果的に回復できる軽量デコーダーを設計し、リアルタイム推論において優れた性能を発揮すること。

提案手法

  • 畳み込みカーネルの重み間にギャップが生じないよう、拡張率に上限を設けることで、受容 field の完全なカバーを保証する。
  • SE-ResNeXt をインspired にした D ブロックを設計し、異なる拡張率を持つ2つの並列 3×3 畳み込みを用いて、広大な視野とローカルディテールの両立を図る。
  • 拡張畳み込みをオフセットパラメータを学習することで微分可能可変畳み込みとして表現し、拡張率の勾配ベース最適化を可能にする。
  • 勾配降下法を用いた微分可能 NAS 法を採用し、バックボーン内のすべてのブロックで同時に拡張率を最適化する。
  • 特徴抽象化の過程で失われた空間的ディテールを効果的に回復できる軽量デコーダーを提案し、局所化精度を向上させる。
  • ImageNet プリトレーニングなしでエンドツーエンド学習を実施し、データ効率と一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1大規模で調整可能な拡張率を持つ拡張畳み込みを、リアルタイム意味セグメンテーションのバックボーンで従来のダウンサンプリングに置き換えることで、より大きな制御可能受容 field を実現できるか?
  • RQ2高解像度特徴量におけるローカル画像ディテールを保持しつつ、視野を最大限に拡大できるか?
  • RQ3微分可能ニューラルアーキテクチャ探索を、意味セグメンテーション用の深層学習モデルにおける拡張率最適化に効果的に適用できるか?
  • RQ4軽量デコーダーは、推論速度を犠牲にせずに、既存のデコーダーと比較して空間的ディテールの回復性能に優れているか?
  • RQ5ImageNet プリトレーニングなしの拡張畳み込みベースのバックボーンは、既存のリアルタイムモデルと比較して、より優れた精度-効率トレードオフを達成できるか?

主な発見

  • RegSeg は、混合精度を用いた T4 GPU 上で、ImageNet プリトレーニングなしで 37 FPS で 78.3 mIOU を達成した。
  • CamVid データセットでは、112 FPS で 80.9 mIOU を達成し、以前の SOTA モデルである DDRNet-23 より 0.8%、BiSeNetV2-L より 2.4% 高い性能を示した。
  • 比較プロットおよび表から明らかになったように、RegSeg は Cityscapes でパラメータ-精度および FLOPS-精度のトレードオフにおいて最高の性能を示した。
  • 同じ学習設定下で DDRNet-23 と比較した場合、RegSeg はより高い FPS(38 対 33)と低いパラメータ数(3.34M 対 20.1M)を達成し、競争力のある性能を維持した。
  • 二重パスの拡張畳み込みブロックを備えた D ブロックにより、有効視野は 2399 にまで拡大され、DeepLabv3+ の 1055 よりも顕著に大きくなったが、同時にローカルディテールを保持した。
  • 拡張率最適化のための微分可能 NAS 法は、手動チューニングと同等の結果をもたらし、受容 field の構成をエンドツーエンド学習で最適化可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。