Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Cluster for Proposal-Free Instance Segmentation

Yen-Chang Hsu, Zheng Xu|arXiv (Cornell University)|Mar 17, 2018
Advanced Neural Network Applications被引用数 6
ひとこと要約

本論文では、ペアワイズピクセル関係性とグラフ彩色理論を活用することで、プロポーザルフリーなインスタンスセグメンテーションを実現する、完全畳み込みネットワーク(FCNs)向けの新規エンドツーエンド学習目的関数を提案する。この手法により、ネットワークはピクセルにクラスタ番号を直接割り当てることができ、外部データを用いないままCityscapesで15.1%のAPを達成し、2017年CVPR自動運転チャレンジのレーン検出コンpetitionで2位を獲得した。

ABSTRACT

This work proposed a novel learning objective to train a deep neural network to perform end-to-end image pixel clustering. We applied the approach to instance segmentation, which is at the intersection of image semantic segmentation and object detection. We utilize the most fundamental property of instance labeling -- the pairwise relationship between pixels -- as the supervision to formulate the learning objective, then apply it to train a fully convolutional network (FCN) for learning to perform pixel-wise clustering. The resulting clusters can be used as the instance labeling directly. To support labeling of an unlimited number of instance, we further formulate ideas from graph coloring theory into the proposed learning objective. The evaluation on the Cityscapes dataset demonstrates strong performance and therefore proof of the concept. Moreover, our approach won the second place in the lane detection competition of 2017 CVPR Autonomous Driving Challenge, and was the top performer without using external data.

研究の動機と目的

  • 混雑したシーンやオクルージョン、変動するオブジェクト数が生じる状況において、プロポーザル生成が非現実的となるようなインスタンスセグメンテーションの課題に対処すること。
  • オブジェクトプロポーザルの必要性を排除し、完全畳み込みネットワークをエンドツーエンドで訓練し、ピクセル単位のクラスタリングを実行させること。
  • 学習目的関数にグラフ彩色にインspiredされた戦略を統合することで、無制限のインスタンス数を扱えるようにネットワークを一般化させること。
  • 既存のプロポーザルフリー手法が性能を発揮しない多クラス・高オクルージョンデータセット(例:Cityscapes)における性能向上を図ること。
  • 外部学習データに依存せずに、リアルタイム推論の可能性と頑健性を示すこと。

提案手法

  • 同じインスタンスに属するピクセルが類似した特徴を持つように促すために、ペアワイズピクセル関係性を監視として用いる新規学習目的関数を定式化する。
  • グラフ彩色理論を損失関数に統合することで、離れたオブジェクト間でクラスタインデックスを再利用可能にし、無制限のインスタンス数の処理を可能にする。
  • マルチタスクヘッド(インスタンスID予測、セマンティックセグメンテーション、オブジェクト中心座標回帰)を備えた完全畳み込みネットワーク(FCN)を訓練する。
  • 1オブジェクトあたり50ピクセルを選択するサンプリング戦略を採用し、256ピクセルのマージンと上位8個の正例ペアを用いたコントラスト学習(式8)を適用する。
  • 連結成分抽出による後処理を実施し、平均オブジェクト中心が20ピクセル以内に位置するセグメントを統合する。
  • マスクサイズに基づいた信頼度スコアを割り当て、小さなマスクは低い信頼度を与えることでAP評価の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトプロポーザルを必要とせずに、エンドツーエンドでトレーニング可能な完全畳み込みネットワークが、ピクセル単位のクラスタリングをインスタンスセグメンテーションに適用できるか。
  • RQ2グラフ彩色理論をどのように深層学習の目的関数に効果的に統合することで、無制限のインスタンス数のクラスタリングを可能にするか。
  • RQ3データ駆動型クラスタリング手法は、JGDのような探索ベースの手法と比較して、インスタンスセグメンテーションベンチマークでどの程度の性能を示すか。
  • RQ4セマンティックセグメンテーションの品質が、プロポーザルフリー手法における最終的なインスタンスセグメンテーションAPスコアにどの程度影響を及えるか。
  • RQ5提案手法は、外部学習データに依存せずに、リアルタイム性能を達成でき、かつ実用的であるか。

主な発見

  • 提案手法はCityscapesデータセットで15.1%の平均精度(AP)を達成し、類似したグラフラベルインサイトを持つJGD手法(9.8% AP)を顕著に上回った。
  • 外部データを一切使用せず、Cityscapesにおけるプロポーザルフリー手法の中で4位にランクインし、2017年CVPR自動運転チャレンジのレーン検出コンテストで2位を獲得した。
  • アノテーション済みセマンティックセグメンテーションとオラクル信頼度順序付けを組み合わせた場合、APスコアは38.4%に向上し、APがセマンティックセグメンテーション品質に強く依存していることが示された。
  • ネットワークは約55 FPSのリアルタイム推論を達成し、実用的導入の可能性を示した。
  • 失敗モードとして過剰セグメンテーションや隣接オブジェクトに同一IDが割り当てられる現象が観察されたが、オブジェクト中心予測に基づく統合処理によりこれらの問題が緩和された。
  • アブレーションスタディにより、セマンティックセグメンテーション品質がAPに強く影響することが確認され、セグメンテーション品質が向上するに従い、APは16.0%から28.4%に上昇した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。