Skip to main content
QUICK REVIEW

[論文レビュー] Scene Parsing with Global Context Embedding

Wei-Chih Hung, Yi‐Hsuan Tsai|arXiv (Cornell University)|Oct 17, 2017
Multimodal Machine Learning Applications参考文献 27被引用数 15
ひとこと要約

本稿では、自己教師ありのシーン類似度学習に用いるシアンプスネットワークと、2つの新規符号化モジュール(グローバルコンテキスト特徴符号化と非パrametric事前符号化)を用いて、グローバルコンテキストを埋め込むことで、意味セグメンテーションを向上させるシーンパースィング手法を提案する。このアプローチにより、誤検出を低減し、MIT ADE20KおよびPASCAL Contextデータセットで最先端の性能を達成し、ベースライン比で最大4.43%のmIoU向上を達成した。

ABSTRACT

We present a scene parsing method that utilizes global context information based on both the parametric and non- parametric models. Compared to previous methods that only exploit the local relationship between objects, we train a context network based on scene similarities to generate feature representations for global contexts. In addition, these learned features are utilized to generate global and spatial priors for explicit classes inference. We then design modules to embed the feature representations and the priors into the segmentation network as additional global context cues. We show that the proposed method can eliminate false positives that are not compatible with the global context representations. Experiments on both the MIT ADE20K and PASCAL Context datasets show that the proposed method performs favorably against existing methods.

研究の動機と目的

  • 局所的コンテキストに依存する既存のシーンパースィング手法の限界、特に砂地や壁のような曖昧な領域での誤検出を解消するため。
  • 推論時にシーンカテゴリラベルを必要とせずに、グローバルシーンコンテキストを統合することで、分類精度を向上させるため。
  • パラメトリックおよび非パラメトリックコンテキストモデリングを活用することで、レアクラスおよび一般的なクラスの一般化性能を向上させる効率的でスケーラブルな手法を開発するため。
  • 既存のセグメンテーションネットワークに最小限の計算コストでグローバルコンテキストの手がかりを統合するため。

提案手法

  • 画像ペアのシーン類似度に基づいて、レアオブジェクトおよび表面カテゴリに注目しながら、自己教師ありで学習されたシアンプスネットワークを用いて、グローバルコンテキスト表現を学習する。
  • グローバルコンテキスト特徴符号化は、学習済みの表現をセグメンテーションネットワークに追加のコンテキスト手がかりとして伝搬する。
  • 非パラメトリック事前符号化は、事前に計算されたコン pact 特徴を用いて類似画像を検索し、検出された画像からグローバルおよび空間的事前情報を生成する。
  • 事前情報生成プロセスは、K=5の最近傍探索と50×50の空間グリッドを用いて、空間に配慮したコンテキストを効率的に符号化する。
  • パラメトリック特徴符号化と非パラメトリック事前符号化を、FCN-8s や DeepLab などの既存の FCN ベースのネットワークに、アーキテクチャの変更なしに統合する。
  • リトリーブは、事前に計算された特徴を用いて画像レベルで実行され、従来の非パラメトリック手法におけるピクセルまたはスーパーピクセルレベルの一致と比較して、計算コストを低減する。

実験結果

リサーチクエスチョン

  • RQ1多様な画像間でのシーン類似度をモデル化することで、自己教師ありのグローバルコンテキスト表現学習がシーンパースィング性能を向上させ得るか?
  • RQ2学習済みのグローバルコンテキスト特徴と非パラメトリック事前情報の統合は、曖昧な領域における誤検出予測の低減にどの程度効果的か?
  • RQ3提案手法は、MIT ADE20K のような複雑なデータセットにおける一般的およびレアな意味的クラスに、十分に一般化できるか?
  • RQ4最小限の推論オーバーヘッドで、既存の最先端のセグメンテーションネットワークにグローバルコンテキスト埋め込みを効率的に適用できるか?

主な発見

  • MIT ADE20K データセットでは、特徴符号化と事前符号化を併用した場合、DeepLab ベースライン比で4.43%のmIoU向上を達成した。
  • 非パラメトリック事前符号化のみを用いた場合、FCN-8s で3.53%、DeepLab で3.42%のmIoU向上を示し、顕著な性能向上を示した。
  • レアクラスでは、4.64%のmIoU向上を達成し、代表されない意味的カテゴリの効果的処理を示した。
  • PASCAL Context データセットでは、46.52%のmIoUと73.80%のピクセル精度を達成し、CRF-RNN や HO_CRF を含む最先端の手法を上回った。
  • 砂地をビーチシーンで山と誤検出するなど、曖昧な領域における誤検出を、グローバルシーンの一貫性を強制することで低減した。
  • 1枚の画像の推論時間はGPUで1.4秒であり、事前符号化モジュールによるオーバーヘッドはわずか0.7秒で、計算効率が優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。