Skip to main content
QUICK REVIEW

[論文レビュー] Single-shot Path Integrated Panoptic Segmentation

Sukjun Hwang, Seoung Wug Oh|arXiv (Cornell University)|Dec 3, 2020
Advanced Neural Network Applications参考文献 41被引用数 7
ひとこと要約

SPINet は、インスタンスセグメンテーションとセマンティックセグメンテーションを統合した1ショット、パス統合型アプローチを提案する。この手法では、インスタンスとセマンティックセグメンテーションを統合した1つの特徴マップ(パンオプティック特徴マップ)に統合し、補助タスクを介して共同最適化することで、1回の順伝播でエンドツーエンドのマスク予測を実現する。このアプローチにより、Cityscapes(63.0% PQ)で最先端の性能を達成し、COCO(42.2% PQ)でも競争力のある結果を出しながら、分離されたブランチを排除することで計算コストを低減し、高い効率性を実現した。

ABSTRACT

Panoptic segmentation, which is a novel task of unifying instance segmentation and semantic segmentation, has attracted a lot of attention lately. However, most of the previous methods are composed of multiple pathways with each pathway specialized to a designated segmentation task. In this paper, we propose to resolve panoptic segmentation in single-shot by integrating the execution flows. With the integrated pathway, a unified feature map called Panoptic-Feature is generated, which includes the information of both things and stuffs. Panoptic-Feature becomes more sophisticated by auxiliary problems that guide to cluster pixels that belong to the same instance and differentiate between objects of different classes. A collection of convolutional filters, where each filter represents either a thing or stuff, is applied to Panoptic-Feature at once, materializing the single-shot panoptic segmentation. Taking the advantages of both top-down and bottom-up approaches, our method, named SPINet, enjoys high efficiency and accuracy on major panoptic segmentation benchmarks: COCO and Cityscapes.

研究の動機と目的

  • パノプティックセグメンテーションのための、インスタンスとセマンティックセグメンテーションを統合した単一で効率的な推論パスの構築。
  • 分離されたインスタンスおよびセマンティックブランチに起因する計算的・アーキテクチャ的オーバーヘッドの排除。
  • 同じインスタンスおよび同じクラスのピクセルのクラスタリングを向上させるために、補助タスクによる特徴表現の改善。
  • 1ショットフレームワーク内でトップダウンとボトムアップの利点を統合し、高い精度と効率性を実現すること。
  • 従来の2ブランチモデルで一般的に見られる「もの(thing)」と「ものでない(stuff)」セグメンテーションの性能差の是正。

提案手法

  • モデルは、共通のバックボーンと FPN から得られる統合されたパンオプティック特徴マップを生成し、インスタンスおよびスタッフ表現を統合する。
  • フィルターサンプリングモジュールは、コンテキストに基づいて動的にインスタンス固有の畳み込みフィルタを生成する。これは CondInst にインspired されたものである。
  • スタッフクラスにはトレーニング可能なフィルタが使用され、インスタンス用フィルタはコンテキストに依存したアテンションによって入力シーンごとに生成される。
  • 特徴クラスタリングと境界検出の向上のため、補助タスク(クラス内トリプレット損失とクラス間ホログラム損失)が適用される。
  • 最終的なセグメンテーションは、パンオプティック特徴マップ全体を1回の畳み込みで処理することで、同時にすべてのマスクを生成する。
  • ResNet ステムを 7×7 から3つの 3×3 畳み込みに変更することで、細粒度の詳細を保持し、性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1分離されたインスタンスおよびセマンティックブランチが存在しない1ショット推論パイプラインに、パノプティックセグメンテーションを効果的に統合できるか?
  • RQ2共有特徴マップにインスタンスとスタッフ表現を統合することで、性能と効率にどのような影響を与えるか?
  • RQ3補助タスクが、パノプティックセグメンテーションにおける特徴クラスタリングと境界検出にどの程度寄与するか?
  • RQ41つの統合モデルが、ASPP や可変畳み込みなどの重いモジュールを用いずに、COCO および Cityscapes の両方で最先端の性能を達成できるか?
  • RQ5パス統合アーキテクチャは、2ブランチベースラインと比較して、計算コストを低減しつつ精度を向上させることができるか?

主な発見

  • SPINet は、Cityscapes のバリデーションセットで 63.0% PQ を達成し、新たな最先端性能を樹立した。
  • COCO では、ResNet-50-FPN バックボーンを用いて 42.2% PQ を達成し、領域提案ネットワークを必要としない2段階手法と同等の性能を示した。
  • インスタンスおよびセマンティックブランチの統合により、モデルパラメータが 10% 減少し、推論 FLOPs が 15% 減少した。
  • 補助タスク(クラス内トリプレット損失およびクラス間ホログラム損失)の導入により、Cityscapes での PQ が 0.7% 向上し、境界およびインスタンス分離性能が向上した。
  • ResNet ステムを3つの 3×3 畳み込みに置き換えることで、Cityscapes での PQ が 2.1% 向上し、細粒度の詳細保持の利点を示した。
  • 1ショットで統合されたアーキテクチャは、パrameter も数と FLOPs が少ないにもかかわらず、分離ブランチベースラインを 0.7% PQ 向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。