Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Segmentation with Reverse Attention

Qin Huang, Chunyang Xia|arXiv (Cornell University)|Jul 20, 2017
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

本稿では、逆学習を通じて陽にポジティブ(対象クラス)およびネガティブ(非対象クラス)の特徴を学習することにより、意味的セグメンテーションを向上させる、三本の並列ブランチからなる完全畳み込みネットワークであるReverse Attention Network(RAN)を提案する。逆注意メカニズムを導入することで、曖昧な領域における応答を強化し、PASCAL-Contextデータセットで48.1%の平均IoUを達成し、PASCAL VOC、NYUDv2、Person-Part、ADE20Kデータセットでも一貫した性能向上を実現した。

ABSTRACT

Recent development in fully convolutional neural network enables efficient end-to-end learning of semantic segmentation. Traditionally, the convolutional classifiers are taught to learn the representative semantic features of labeled semantic objects. In this work, we propose a reverse attention network (RAN) architecture that trains the network to capture the opposite concept (i.e., what are not associated with a target class) as well. The RAN is a three-branch network that performs the direct, reverse and reverse-attention learning processes simultaneously. Extensive experiments are conducted to show the effectiveness of the RAN in semantic segmentation. Being built upon the DeepLabv2-LargeFOV, the RAN achieves the state-of-the-art mIoU score (48.1%) for the challenging PASCAL-Context dataset. Significant performance improvements are also observed for the PASCAL-VOC, Person-Part, NYUDv2 and ADE20K datasets.

研究の動機と目的

  • 既存の意味的セグメンテーションネットワークが対象クラスに関連する特徴のみに注目するという制限を是正し、境界領域での混乱を軽減すること。
  • 重なっているか、視覚的パターンが類似しているために応答が弱い複雑な領域におけるセグメンテーション精度を向上させること。
  • 「逆」の概念を学習することで、ネットワークに対象クラスと非対象クラスを明示的に区別させること。
  • 新規の逆注意メカニズムを用いて、曖昧な空間領域における特徴の識別能を向上させること。
  • DeepLabv2-LargeFOVバックボーンを変更した手法を用いて、複数のベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • RANアーキテクチャは、対象クラスの標準的セグメンテーションを処理する直接ブランチ、対象クラスに関連しない特徴を学習する逆ブランチ、および弱い応答を示す曖昧な領域の応答を強化するための学習可能な注意マスクを適用する逆注意ブランチの三つの並列ブランチから構成される。
  • 逆注意ブランチは、シグモイド活性化されたマスクを用い、信頼度が低いか曖昧性が高い局所領域に注目することで、応答の差別化を向上させる。
  • ネットワークは、三つのブランチすべてに対して交差エントロピー損失を用いてエンドツーエンドで訓練され、すべてのブランチからの特徴マップが統合されて最終予測が得られる。
  • 本手法は、Dilated Convolutionとマルチスケールコンテキスト集約を活用するResNet-101を用いたDeepLabv2-LargeFOVに基づいている。
  • 対象オブジェクトが背景や他のオブジェクトと視覚的に類似している領域において、特定クラスの逆注意マスクを生成し、応答を特に強化する。
  • 最終的なセグメンテーション出力は、三つのブランチからの予測を統合することで得られ、正例と負例の両方の知識を組み合わせることで局所化精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1対象クラスの「逆」を学習することで、曖昧または境界領域における意味的セグメンテーションの性能が向上するか?
  • RQ2混乱した空間パターンにおいて弱い応答を強化する専用の逆注意メカニズムが、より高いセグメンテーション精度をもたらすか?
  • RQ3非対象特徴の明示的モデリングにより、類似クラス間の混乱、またはオブジェクトと背景との混乱が軽減されるか?
  • RQ4標準的意味的学習と逆学習を統合することで、多様なデータセットにおいて一貫した性能向上が得られるか?
  • RQ5RANアーキテクチャは、PASCAL-Context、PASCAL VOC、NYUDv2、ADE20Kといった困難なベンチマークで最先端の性能を達成できるか?

主な発見

  • RANはPASCAL-Contextデータセットで48.1%の最先端の平均IoUを達成し、ベースラインのDeepLabv2-LargeFOVを顕著に上回った。
  • PASCAL VOC2012データセットでは、RANはベースラインを1.4%向上させ、RAN-sで80.5%、RAN-nで80.4%の平均IoUを達成した。
  • NYUDv2データセットでは、RANはベースラインのDeepLabv2-LargeFOVを約3.9ポイント向上させ、RAN-sで41.2%、RAN-nで40.7%の平均IoUを達成した。
  • ADE20Kデータセットでは、RANは平均IoUを35.2%(RAN-s)および35.3%(RAN-n)にまで引き上げ、ベースラインのDeepLabv2-LargeFOVに対して約2%の向上を達成した。
  • NYUDv2における定性的な結果では、RANが特に重なっているオブジェクトを有する複雑な屋内シーンにおいて、より鋭く正確な予測を生成することが確認された。
  • アブレーションスタディの結果、逆注意メカニズムが、特に応答信頼度が低い領域で顕著な性能向上に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。