Skip to main content
QUICK REVIEW

[論文レビュー] Error Correction for Dense Semantic Image Labeling

Yu-Hui Huang, Jia Xu|arXiv (Cornell University)|Dec 11, 2017
Advanced Neural Network Applications参考文献 29被引用数 6
ひとこと要約

この論文は、初期セグメンテーションマップの誤りを是正するための、新しいエンドツーエンドで並列処理可能な後処理フレームワークを提案している。このフレームワークは、3つの構成要素で構成される:ラベル伝播(文脈を用いて境界を洗練)、ラベル置換(誤った領域に対して新しいラベルを生成)、統合(学習された重み付けを用いて結果を統合)。本手法はPASCAL VOC 2012およびHELEN顔パーツ解析データセットにおいて最先端の性能を達成し、顔パーツ解析ではF-measureを2%向上させ、物体境界付近でのCRFベースの最適化手法を上回った。

ABSTRACT

Pixelwise semantic image labeling is an important, yet challenging, task with many applications. Typical approaches to tackle this problem involve either the training of deep networks on vast amounts of images to directly infer the labels or the use of probabilistic graphical models to jointly model the dependencies of the input (i.e. images) and output (i.e. labels). Yet, the former approaches do not capture the structure of the output labels, which is crucial for the performance of dense labeling, and the latter rely on carefully hand-designed priors that require costly parameter tuning via optimization techniques, which in turn leads to long inference times. To alleviate these restrictions, we explore how to arrive at dense semantic pixel labels given both the input image and an initial estimate of the output labels. We propose a parallel architecture that: 1) exploits the context information through a LabelPropagation network to propagate correct labels from nearby pixels to improve the object boundaries, 2) uses a LabelReplacement network to directly replace possibly erroneous, initial labels with new ones, and 3) combines the different intermediate results via a Fusion network to obtain the final per-pixel label. We experimentally validate our approach on two different datasets for the semantic segmentation and face parsing tasks respectively, where we show improvements over the state-of-the-art. We also provide both a quantitative and qualitative analysis of the generated results.

研究の動機と目的

  • ディープラーニングモデルが密集したセマンティックラベリングにおいて、過度に滑らかになりがちな境界とラベル依存関係のモデル化に失敗するという限界を是正すること。
  • 手動で設計されたポテンシャル関数と遅い最適化に依存するCRFベースの後処理手法の非効率性とハイパーパrameterへの感受性を克服すること。
  • 任意の初期セグメンテーション予測結果の上に適用可能な汎用的で効率的かつエンドツーエンドの誤り是正フレームワークを構築すること。
  • 並列的誤り是正戦略により、物体セグメンテーションタスクにおける境界の正確性とラベルの正しさを両方向上させること。

提案手法

  • 本手法は、同じエンコーダ・デコーダバックボーンを共有する3つのサブネットワーク(ラベル伝播、ラベル置換、統合)からなる並列アーキテクチャを採用している。
  • ラベル伝播ネットワークは、周囲のピクセルから正しいラベルを伝搬させるための2次元の変位場を予測し、境界の明確化を図る。
  • ラベル置換ネットワークは、入力画像と初期ラベルマップから直接、新しいセグメンテーション確率マップを回帰し、誤分類された領域を是正する。
  • 統合ネットワークは、予測されたアテンションマスクを用いて2つのブランチの出力を結合し、伝播結果と置換結果の適応的重み付けを可能にする。
  • 全パイプラインは、複数タスク学習の形でエンドツーエンドに訓練され、すべてのコンponentsを統合最適化する。
  • 本手法は、DeepLab-v2 や顔パーツ解析モデルなどの任意の事前学習済み密集ラベリングモデルの上位に後処理ステップとして適用可能である。

実験結果

リサーチクエスチョン

  • RQ1ラベル伝播とラベル置換を組み合わせた後処理フレームワークは、標準のCRFベースの最適化を上回る密集セマンティックセグメンテーション性能を達成できるか?
  • RQ2逐次的または単一戦略的手法と比較して、誤り是正に並列アーキテクチャを用いることはどの程度効果的か?
  • RQ3本手法は、物体セグメンテーションおよび顔パーツ解析タスクの両方において、境界の正確性と誤分類領域の是正にどの程度寄与できるか?
  • RQ4統合機構は、ラベル伝播と置換の寄与度を最適にバランスさせるか?

主な発見

  • PASCAL VOC 2012の検証セットでは、ベースラインのDeepLab-v2に比べてmIoUが1.8%向上し、Dense CRF後処理を施したDeepLab-v2に比べても1.2%向上した。
  • HELEN顔パーツ解析データセットでは、F-measureがベースラインの83.96%から85.90%に向上し、相対的に1.94%の改善を達成した。
  • 物体境界付近での性能が優れており、トリマップ領域(1〜40ピクセル幅)における平均IoUが、ベースラインおよびCRFベース手法を上回った。
  • 定性的な結果から、本手法は物体の形状をより良く保持し、特に目や口のような細かな構造の境界を明確に改善していることが示された。
  • 失敗事例から、物体の大部分が初期段階で誤分類されている場合には、本手法が大規模な分類誤りを完全に是正できないことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。