Skip to main content
QUICK REVIEW

[論文レビュー] Improving Semantic Segmentation via Decoupled Body and Edge Supervision

Xiangtai Li, Xia Li|arXiv (Cornell University)|Jul 20, 2020
Advanced Neural Network Applications参考文献 67被引用数 19
ひとこと要約

本論文は、物体の整合性と境界の正確性を向上させるために、セマンティックセグメンテーションのための新しい分離されたボディとエッジの監視フレームワークを提案する。高周波数のエッジ特徴と低周波数のボディ特徴を別々に最適化することで、学習可能なフローフィールドを用いて特徴をワープし、ボディの一貫性を向上させるとともに、エッジとボディのコンポーネントに別々の監視を適用する。この手法により、細かいアノテーションデータのみを用いても、Cityscapesで83.7%のmIoUを達成し、最先端の性能を実現した。

ABSTRACT

Existing semantic segmentation approaches either aim to improve the object's inner consistency by modeling the global context, or refine objects detail along their boundaries by multi-scale feature fusion. In this paper, a new paradigm for semantic segmentation is proposed. Our insight is that appealing performance of semantic segmentation requires extit{explicitly} modeling the object extit{body} and extit{edge}, which correspond to the high and low frequency of the image. To do so, we first warp the image feature by learning a flow field to make the object part more consistent. The resulting body feature and the residual edge feature are further optimized under decoupled supervision by explicitly sampling different parts (body or edge) pixels. We show that the proposed framework with various baselines or backbone networks leads to better object inner consistency and object boundaries. Extensive experiments on four major road scene semantic segmentation benchmarks including extit{Cityscapes}, extit{CamVid}, extit{KIITI} and extit{BDD} show that our proposed approach establishes new state of the art while retaining high efficiency in inference. In particular, we achieve 83.7 mIoU \% on Cityscape with only fine-annotated data. Code and models are made available to foster any further research (\url{https://github.com/lxtGH/DecoupleSegNets}).

研究の動機と目的

  • 物体の内部整合性を維持する点や、細かい境界の詳細を保つ点で、セマンティックセグメンテーションモデルの限界を是正すること。
  • 統一的で分離されたフレームワークを用いて、セグメンテーション特徴の高周波数(エッジ)および低周波数(ボディ)成分を明示的にモデル化すること。
  • タスク固有の監視を用いてボディとエッジ特徴を共同最適化することで、ロードシーンベンチマークにおける性能を向上させること。
  • 推論効率を損なわず、特に細かいアノテーションデータのみを用いた設定でも最先端の結果を達成すること。

提案手法

  • 学習可能なフローフィールドを用いて特徴マップをワープし、ピクセルを物体の中心に向けて整列させることで、ボディの一貫性を向上させる。
  • 学習済みのフローフィールドを用いて入力特徴マップをワープすることで、滑らかで一貫性のある表現としてボディ特徴を抽出する。
  • 元の特徴マップからボディ特徴を差し引くことでエッジ特徴を取得し、高周波数の詳細を保持する。
  • ボディ特徴はエッジを除くマスクを用いた標準的な交差エントロピー損失で監視されるが、エッジ特徴は別個のエッジマスクで監視される。
  • 洗練されたボディおよびエッジ特徴を統合して再構築された特徴マップを、標準的な交差エントロピー損失で監視する。
  • トレーニング中に境界リラクゼーションを適用することで、ボディとエッジの予測の相補性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ボディとエッジコンポーネントに分離してセマンティック特徴学習を行うことで、セグメンテーション性能が向上するか?
  • RQ2高周波数および低周波数コンポーネントに明示的な監視を施すことで、より良い物体の整合性と境界の正確性が達成できるか?
  • RQ3フローベースドのワープメカニズムは、特徴空間における物体ボディの一貫性を効果的に向上させられるか?
  • RQ4mIoUおよび推論効率の観点から、分離された監視はエンドツーエンド学習と比べてどのように差がつくか?
  • RQ5提案手法は、粗いアノテーションを必要とせず、細かいアノテーションデータのみで最先端の結果を達成できるか?

主な発見

  • 提案手法は、細かいアノテーションデータのみを用いて、Cityscapesのテストセットで83.7%のmIoUを達成し、新たな最先端の記録を樹立した。
  • Cityscapesでは、19のカテゴリのうち18のカテゴリで既存の手法を上回り、特に「ポール」や「交通標識」などの小規模オブジェクトカテゴリで顕著な向上を示した。
  • Cityscapesのテストセットで、細かいアノテーションのみを用いても82.8%のmIoUを達成し、G-SCNN や AutoDeepLab-L などの先行SOTA手法を上回った。
  • 可視化結果から、本手法は大規模オブジェクトの内部のぼやけを効果的に低減し、特にDeeplabv3+において小規模オブジェクトの欠落した境界詳細を回復していることが確認された。
  • フローフィールドの可視化から、モデルが物体領域内のピクセルを意味のある空間変換に従って整列させ、特徴の整合性を向上させていることが裏付けられた。
  • アブレーションスタディの結果、分離された監視は複数のバックボーンネットワークおよびベースラインにおいて一貫した向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。