Skip to main content
QUICK REVIEW

[論文レビュー] Universal Semi-Supervised Semantic Segmentation

Tarun Kalluri, Girish Varma|arXiv (Cornell University)|Nov 26, 2018
Domain Adaptation and Few-Shot Learning参考文献 74被引用数 14
ひとこと要約

本稿では、限られたラベル付きデータと豊富なラベルなしデータを用いて、重複のないラベル空間を持つ複数のドメインにまたがる1つのモデルを訓練する、ユニバーサルな半教師ありセマンティックセグメンテーションフレームワークを提案する。ピクセルに敏感なエントロピー正則化を活用して、ラベル空間が重複しないドメイン間で特徴を整合させる。この手法は、Cityscapes、SUN、IDDといった多様なデータセットで最先端の性能を達成し、1ドメインあたりたった1,500例のラベル付き例を用いても、教師ありおよび統合学習ベースラインを上回る。

ABSTRACT

In recent years, the need for semantic segmentation has arisen across several different applications and environments. However, the expense and redundancy of annotation often limits the quantity of labels available for training in any domain, while deployment is easier if a single model works well across domains. In this paper, we pose the novel problem of universal semi-supervised semantic segmentation and propose a solution framework, to meet the dual needs of lower annotation and deployment costs. In contrast to counterpoints such as fine tuning, joint training or unsupervised domain adaptation, universal semi-supervised segmentation ensures that across all domains: (i) a single model is deployed, (ii) unlabeled data is used, (iii) performance is improved, (iv) only a few labels are needed and (v) label spaces may differ. To address this, we minimize supervised as well as within and cross-domain unsupervised losses, introducing a novel feature alignment objective based on pixel-aware entropy regularization for the latter. We demonstrate quantitative advantages over other approaches on several combinations of segmentation datasets across different geographies (Germany, England, India) and environments (outdoors, indoors), as well as qualitative insights on the aligned representations.

研究の動機と目的

  • 屋外ドライブシーンや屋内環境など多様なドメインにまたがるセマンティックセグメンテーションデータのアノテーションにかかる高コストと重複を低減すること。
  • ラベル空間の重複を仮定しない最小限のラベル付きデータで、ドメインをまたいで一般化する統一モデルの開発。
  • 各ドメインからの大規模なラベルなしデータを活用し、ドメイン固有のファインチューニングや別々のモデルを必要とせずにモデル性能を向上させること。
  • 現実のセグメンテーション応用において、ドメインシフト、深刻な忘却、ラベル空間の不一致といった既存手法の制限を克服すること。

提案手法

  • 少数のラベル付き例に対する教師あり損失と、ラベルなしデータに対する非教師ありエントロピー正則化の組み合わせを用いて、複数のデータセットにまたがる1つの深層ニューラルネットワークを共同で訓練する。
  • ピクセル単位のエントロピー最小化に基づく新しい特徴整合目的関数を導入し、ラベル空間が重複しないドメイン間で一貫した予測を促進する。
  • エンコーダー特徴マップとクラスプロトタイプ(ラベル埋め込み)間の類似度スコアを計算し、この分布のエントロピーを最小化することで予測を精緻化する。
  • ドメイン内およびドメイン間のエントロピー最小化を適用し、ラベルセットが重複しない場合でも、異なるデータセット間で特徴を整合させる。
  • 密度予測タスクに適した高解像度特徴を抽出するため、ドーナツ型残差ネットワークをリサンプル50バックボーンを用いる。
  • 教師ありおよび非教師あり損失を組み合わせたマルチタスク学習目的関数を用いて、モデルをエンドツーエンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1非重複ラベル空間を持つ複数のセマンティックセグメンテーションデータセットに、限られたラベル付きデータのみを用いて1つのモデルを効果的に訓練できるか?
  • RQ2エントロピーに基づく特徴整合は、照明、天候、シーンコンテンツのドメインシフトが生じる状況下でも、ドメイン間での一般化をどのように向上させるか?
  • RQ3教師ありまたは統合学習ベースラインと比較して、多様なドメインからのラベルなしデータは、性能向上にどの程度寄与するか?
  • RQ4ラベルが意味的に類似しているが同一ではない場合でも、エントロピー正則化を用いたドメイン間特徴整合は、より良い表現学習をもたらすか?

主な発見

  • 本手法は、1ドメインあたりたった1,500例のラベル付き例を用いて、ユニバーサルセグメンテーションベンチマークで50.52%のmIoUを達成し、ベースラインのUniv-basicモデル(44.78% mIoU)を上回った。
  • CityscapesおよびSUNデータセットでは、それぞれ57.91%および43.12%のmIoUを達成し、統合学習ベースラインを上回り、強力なドメイン間転送性能を示した。
  • SUN-RGBDのトレーニングデータの28%しか使用せず、合成データも一切使用しなかったにもかかわらず、5.3kのラベル付き例と合成RGB-深度データを用いたSceneNetが報告したmIoUの88%に達した。
  • t-SNE可視化により、ラベルが重複しないにもかかわらず、「Road」と「Floor」のような意味的に類似したクラスが、ドメインをまたいで特徴空間で一貫して整合されていることが確認された。
  • 予測エントロピーがドメイン全体で著しく低下し、未学習ドメインにおける予測の信頼性と一貫性が向上していることが示された。
  • ラベル付きデータが限られる半教師あり設定では、敵対的損失に基づく手法よりもエントロピー最小化が優れていることが判明し、特にラベル付きデータが少ない状況で顕著だった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。