Skip to main content
QUICK REVIEW

[論文レビュー] DSNet: A Novel Way to Use Atrous Convolutions in Semantic Segmentation

Zilu Guo, Liuyang Bian|arXiv (Cornell University)|Jun 6, 2024
Neural Networks and Applications被引用数 4
ひとこと要約

DSNetは、浅い層にアトリウス畳み込みを適用する新しい二重ブランチCNNアーキテクチャを提案する。このアーキテクチャは、3つの経験的原則に従う:アトリウス畳み込みとドライブルック畳み込みの組み合わせ、最適なレート選択による「アトリウス災害」の回避、効果的な特徴統合メカニズムの使用。モデルは、Cityscapesで81.9 FPSで80.4% mIOU、ADE20Kで179.2 FPSで40.0% mIOUを達成し、リアルタイムのTransformerベースおよびCNNベースのモデルを上回る、最先端の精度-速度トレードオフを実現した。

ABSTRACT

Atrous convolutions are employed as a method to increase the receptive field in semantic segmentation tasks. However, in previous works of semantic segmentation, it was rarely employed in the shallow layers of the model. We revisit the design of atrous convolutions in modern convolutional neural networks (CNNs), and demonstrate that the concept of using large kernels to apply atrous convolutions could be a more powerful paradigm. We propose three guidelines to apply atrous convolutions more efficiently. Following these guidelines, we propose DSNet, a Dual-Branch CNN architecture, which incorporates atrous convolutions in the shallow layers of the model architecture, as well as pretraining the nearly entire encoder on ImageNet to achieve better performance. To demonstrate the effectiveness of our approach, our models achieve a new state-of-the-art trade-off between accuracy and speed on ADE20K, Cityscapes and BDD datasets. Specifically, DSNet achieves 40.0% mIOU with inference speed of 179.2 FPS on ADE20K, and 80.4% mIOU with speed of 81.9 FPS on Cityscapes. Source code and models are available at Github: https://github.com/takaniwa/DSNet.

研究の動機と目的

  • Semantic Segmentationにおけるアトリウス畳み込みの使用を再評価すること、特にそれらが未活用されている浅いネットワーク層における使用を対象とする。
  • 先行研究で観察された制限を解消するため、CNNにおける効果的なアトリウス畳み込みの適用に向けた経験的ガイドラインを同定および形式化すること。
  • これらのガイドラインを活用して、リアルタイムおよび高精度セグメンテーションタスクの両方で性能を向上させる、二重ブランチで同じ解像度を維持するネットワーク(DSNet)を設計すること。
  • ADE20K、Cityscapes、BDDといったベンチマークデータセットで、mIOUと推論速度の両面で最先端の性能を達成すること。

提案手法

  • 著者らは3つの経験的ガイドラインを提案する:(1) アトリウス畳み込みのみではなく、アトリウス畳み込みとドライブルック畳み込みを組み合わせること;(2) パフォーマンスの低下(「アトリウス災害」)を避けるために、アトリウスレートを慎重に選択すること;(3) 多スケール特徴を統合するための効果的な統合メカニズムを使用すること。
  • DSNetは、二重ブランチのCNNアーキテクチャであり、二つの並列ブランチで構成される:文脈ブランチ(大きなカーネルサイズのスタックドアトリウス畳み込みを使用)と空間ブランチ(標準畳み込みを使用)、両方とも同じ解像度を維持する。
  • 特徴表現と統合を強化するために、マルチスケール統合アトリウス畳み込みブロック(MFACB)、マルチスケールアテンション統合モジュール(MSAF)、およびシリアル・パラレルアトリウス空間的アパーチャープールイング(SPASPP)モジュールを採用している。
  • エンコーダー全体はImageNetで事前学習されており、特にアトリウス畳み込みが適用される浅い層において、特徴学習と一般化性能が向上する。
  • 標準的なエンコーダ-デコーダ構造にスキップ接続を採用し、二重ブランチからの特徴を連結してアップサンプリングし、最終的なセグメンテーション予測を生成する。
  • 性能評価は、標準的な単一スケール推論プロトコルに従い、ADE20K、Cityscapes、BDDデータセットでmIOUとFPSを用いて実施される。

実験結果

リサーチクエスチョン

  • RQ1CNNの浅い層におけるアトリウス畳み込みの効果的使用を妨げる主な要因は何であるか?
  • RQ2特徴品質の劣化を伴わずに、受容 field の拡大を最大化するアトリウス畳み込みの適用方法は何か?
  • RQ3浅い層でアトリウス畳み込みとドライブルック畳み込みを組み合わせることで、単独で使用する場合よりも優れた性能が得られるか?
  • RQ4アトリウス畳み込みをネットワークの初期段階に適用する場合、ImageNet事前学習が果たす役割は何か?
  • RQ5文脈ブランチにアトリウス畳み込みを適用する二重ブランチで同じ解像度を維持するアーキテクチャが、既存のリアルタイムおよび高精度モデルを上回る性能を発揮できるか?

主な発見

  • Cityscapesでは2048×1024解像度で81.9 FPSで80.4% mIOUを達成し、リアルタイムセマンティックセグメンテーション分野で新たな最先端水準を樹立した。
  • ADE20Kでは179.2 FPSで40.0% mIOUを達成し、高精度ベンチマークにおいて優れた精度-速度トレードオフを示した。
  • DSNet-BaseはCityscapesで82.0% mIOUを達成し、HRNetV2-W48(81.1%)やOCRNet(81.6%)といった高精度モデルを上回ったが、パラメータ数は37.5Mと少ない。
  • SFNet(ResNet18)と比較して、DSNetは2.2%高いmIOUを達成し、推論速度も速かった。また、SFNet-Lite(STDC-2)と比較して3.4%高いmIOUを達成し、速度低下はわずか0.3msにとどまった。
  • アブレーションスタディの結果、提案されたガイドライン(アトリウス畳み込みとドライブルック畳み込みの組み合わせ、最適なアトリウスレート選択、適切な統合)が性能向上に顕著に寄与することが確認された。
  • 適切な設計原則に従って浅い層にアトリウス畳み込みを適用することで、優れた特徴学習とセグメンテーション精度が実現されることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。