Skip to main content
QUICK REVIEW

[論文レビュー] DSNet: An Efficient CNN for Road Scene Segmentation

Ping-Rong Chen, Hsueh‐Ming Hang|arXiv (Cornell University)|Apr 10, 2019
Advanced Neural Network Applications参考文献 36被引用数 6
ひとこと要約

DSNetは、DenseNet、ResNet、FCNの有利な要素を組み合わせることで、リアルタイムの道路シーンセグメンテーションを実現する軽量で効率的なCNNアーキテクチャを提案する。計算コストが低くても高い精度を達成しており、GTX 1080Tiで1枚あたり0.0147秒(68 FPS)の速度でCityscapesで69.1%のmIoUを達成する。リアルタイム推論を実現しながらも、競争力のある精度を維持している。

ABSTRACT

Road scene understanding is a critical component in an autonomous driving system. Although the deep learning-based road scene segmentation can achieve very high accuracy, its complexity is also very high for developing real-time applications. It is challenging to design a neural net with high accuracy and low computational complexity. To address this issue, we investigate the advantages and disadvantages of several popular CNN architectures in terms of speed, storage and segmentation accuracy. We start from the Fully Convolutional Network (FCN) with VGG, and then we study ResNet and DenseNet. Through detailed experiments, we pick up the favorable components from the existing architectures and at the end, we construct a light-weight network architecture based on the DenseNet. Our proposed network, called DSNet, demonstrates a real-time testing (inferencing) ability (on the popular GPU platform) and it maintains an accuracy comparable with most previous systems. We test our system on several datasets including the challenging Cityscapes dataset (resolution of 1024x512) with an mIoU of about 69.1 % and runtime of 0.0147 second per image on a single GTX 1080Ti. We also design a more accurate model but at the price of a slower speed, which has an mIoU of about 72.6 % on the CamVid dataset.

研究の動機と目的

  • リアルタイムの自律走行アプリケーション向けに、高いセグメンテーション精度と低い計算複雑性を両立する畳み込みニューラルネットワークの設計。
  • FCN、ResNet、DenseNetといった代表的なCNNアーキテクチャ間の、速度、メモリ使用量、精度のトレードオフを分析・比較すること。
  • 既存のアーキテクチャから最も効果的なコンponentsを同定し、新規で効率的なネットワークアーキテクチャに統合すること。
  • 標準的なGPUハードウェア上で、セグメンテーション性能を損なわずにリアルタイム推論を可能にするモデルの開発。

提案手法

  • 著者たちは、VGGをベースラインとして用いた完全畳み込みネットワーク(FCN)から出発し、道路シーンセグメンテーションの文脈でResNetおよびDenseNetを体系的に評価する。
  • パラメータ数と計算負荷を低減するために、DenseNetから特に密な接続と特徴の再利用という有利なアーキテクチャ的要素を抽出する。
  • 最終的なDSNetアーキテクチャは、セマンティックセグメンテーションに最適化された簡素化されたエンコーダ・デコーダ構造に、これらの効率的コンponentsを統合することで構築される。
  • 特徴の伝搬と勾配の流れを向上させるために、密なスキップ接続を採用し、学習効率と精度の向上を図る。
  • 消費者向けGPUでの推論に最適化するため、アーキテクチャの剪定と最適化をさらに実施して、モデルの効率性を向上させる。
  • 本手法には2つのバージョンを含む:リアルタイム性能を最適化した高速推論モデルと、より高いmIoUを求めるがやや遅延の大きいバージョン。

実験結果

リサーチクエスチョン

  • RQ1軽量なCNNアーキテクチャは、道路シーンデータセットで高いセグメンテーション精度を維持しながら、リアルタイム推論速度を達成できるか?
  • RQ2ResNet、DenseNet、FCNのアーキテクチャ的要素の中で、道路シーンセグメンテーションの精度と効率性に最も寄与するのはどれか?
  • RQ3密な接続と特徴の再利用の統合は、モデルのパフォーマンスと計算コストにどのように影響を与えるか?
  • RQ4標準的なGPUハードウェア上でリアルタイム展開を最適化する際、推論速度とmIoUのトレードオフはどのようなものか?

主な発見

  • DSNetは、GTX 1080Ti上で1枚あたり0.0147秒(約68 FPS)の実行時間で、Cityscapesデータセットで69.1%の平均交差率(mIoU)を達成し、リアルタイム推論を実現している。
  • 従来の最先端モデルと比較して、計算複雑性を顕著に低減しながらも、競争力ある精度を維持している。
  • より高精度なDSNetのバージョンは、CamVidデータセットで72.6%のmIoUを達成しており、高精度な応用に向けたスケーラビリティを示している。
  • アブレーションスタディの結果、DenseNet由来の密な接続と特徴の再利用が、パrameter数とFLOPsを低減しつつ性能向上に寄与することが確認された。
  • さまざまな解像度や複雑さを有する道路シーンデータセット(CityscapesやCamVidを含む)において、強力な汎化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。