Skip to main content
QUICK REVIEW

[論文レビュー] SegSort: Segmentation by Discriminative Sorting of Segments

Jyh-Jing Hwang, Stella X. Yu|arXiv (Cornell University)|Oct 15, 2019
Advanced Image and Video Retrieval Techniques参考文献 81被引用数 10
ひとこと要約

SegSortは、画像のセグメンテーションを埋め込み空間内のセグメントの判別的ソートとして扱う、エンドツーエンドのディープメトリック学習アプローチを提案する。2段階のEMフレームワーク(球面K-meansと近接成分分析)を用いて、セグメント内類似度の最適化とセグメント間非類似度の最適化を実現することで、教師あり学習時の76%の性能を無教師学習で達成し、従来のピクセル単位のソフトマックス手法に比べて境界の精度と一貫性が向上する。

ABSTRACT

Almost all existing deep learning approaches for semantic segmentation tackle this task as a pixel-wise classification problem. Yet humans understand a scene not in terms of pixels, but by decomposing it into perceptual groups and structures that are the basic building blocks of recognition. This motivates us to propose an end-to-end pixel-wise metric learning approach that mimics this process. In our approach, the optimal visual representation determines the right segmentation within individual images and associates segments with the same semantic classes across images. The core visual learning problem is therefore to maximize the similarity within segments and minimize the similarity between segments. Given a model trained this way, inference is performed consistently by extracting pixel-wise embeddings and clustering, with the semantic label determined by the majority vote of its nearest neighbors from an annotated set. As a result, we present the SegSort, as a first attempt using deep learning for unsupervised semantic segmentation, achieving $76\%$ performance of its supervised counterpart. When supervision is available, SegSort shows consistent improvements over conventional approaches based on pixel-wise softmax training. Additionally, our approach produces more precise boundaries and consistent region predictions. The proposed SegSort further produces an interpretable result, as each choice of label can be easily understood from the retrieved nearest segments.

研究の動機と目的

  • 現在のディープラーニング手法がセマンティックセグメンテーションをピクセル単位の分類として扱うという限界に対処すること。これは、視覚的シーンのヒューマンの知覚的グループ化を反映していない。
  • 視覚的および意味的類似度に基づいて画像間でセグメントをソートすることで、視覚的表現を学ぶ非パrametricでエンドツーエンドで訓練可能なフレームワークを開発すること。
  • 任意の真値ラベルを必要とせず、輪郭ベースの疑似マスクとメトリック学習のみを用いて無教師セマンティックセグメンテーションを可能にすること。
  • 各ラベル予測が参照セットからの最近傍セグメントを検索することで説明可能である、解釈可能なセグメンテーション結果を生成すること。
  • 従来のパrametricなピクセル単位の予測モデルに比べて、境界の精度と領域の一貫性を向上させること。

提案手法

  • CNNを用いて各ピクセルを視覚的埋め込み空間内の点にマッピングし、空間的な近接性がセグメント所属を示す。
  • 2段階の期待値最大化(EM)フレームワークを採用:まず、球面(ボン・ミーゼ・フィッシャー)K-meansクラスタリングが埋め込み空間で画像セグメンテーションを実行する。
  • 次に、Eステップをピクセルからセグメントへの損失に適応させ、CNNのメトリック学習を最適化し、セグメント内類似度を最大化し、セグメント間非類似度を最小化する。
  • 無教師学習では、HEDライン検出器(HED-owt-ucm)を用いて輪郭ベースの疑似セグメンテーションマスクを生成し、意味ラベルを一切使用せずに視覚的境界を提供する。
  • 教師あり設定では、近接成分分析(NCA)基準を組み込み、最近傍多数決による意味ラベルの割り当てを精緻化する。
  • セグメントの検索と階層的クラスタリング(FINCH)を用いて、自動的に視覚的グループを発見し、学習された埋め込み空間内に微細な視覚的構造を明らかにする。

実験結果

リサーチクエスチョン

  • RQ1ディープメトリック学習を用いて、セグメントの判別的ソートとしてエンドツーエンドのセマンティックセグメンテーションを実現できるか?
  • RQ2非パrametricで埋め込みベースのアプローチは、教師ありおよび無教師両設定において、従来のパrametricなピクセル単位分類より優れた性能を示せるか?
  • RQ3提案手法は、従来のソフトマックスベースのモデルに比べて、より正確な境界と一貫性のある領域予測を生成するか?
  • RQ4真値ラベルが一切ない状態で、輪郭ベースの疑似マスクでの無教師学習が意味のあるセマンティックセグメンテーションを可能にするか?
  • RQ5参照セットのアノテート済みセグメントからの最近傍検索によって、モデルの予測が本質的に解釈可能になるか?

主な発見

  • 無教師学習におけるSegSortは、PASCAL VOC 2012データセットにおいて、教師あり対応手法の平均交差率(mIoU)の76%に達する。
  • HED-owt-ucmマスクを用いた事前学習特徴のクラスタリングベースラインを上回り、エンドツーエンドのメトリック学習の有効性を示す。
  • 無教師事前学習済み埋め込みからの微調整は、ランダム初期化よりも性能を向上させ、学習済み表現の転送可能性を示す。
  • 無教師学習で得られた埋め込みは、意味的意味よりも視覚的類似度(例:テクスチャ、色)に注目しており、輪郭ベースの疑似マスクの使用と整合的である。
  • セグメントプロトタイプに対する階層的凝集クラスタリング(FINCH)により、顔、髪、ブルーシャツ、ホイールなど、自動で発見された視覚的グループが明らかになり、埋め込み空間内に構造的な意味的組織が存在することを示す。
  • 境界Fスコアの高い結果から、従来のパrametricなピクセル単位モデルに比べ、より正確な境界と一貫性のある領域予測を生成することが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。