Skip to main content
QUICK REVIEW

[論文レビュー] Multi-domain semantic segmentation with pyramidal fusion

Petra Bevandić, Marin Oršić|arXiv (Cornell University)|Sep 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 19被引用数 4
ひとこと要約

本論文は、クラス分布が異なる多様なデータセットを処理するために、ResNet-152バックボーンにおけるピラミッド特徴統合を用いたマルチドメイン意味セグメンテーションモデルを提案する。境界認識型フォーカル重み付けを組み込んだ新規のlog-sum-prob損失を導入し、VIPERで62.5%のmIoU、WildDash 2で45.4%を達成するなど、分布外ベンチマークで最先端の性能を発揮するとともに、最小限のドメイン特化的適応でドメイン間で堅牢性を維持する。

ABSTRACT

We present our submission to the semantic segmentation contest of the Robust Vision Challenge held at ECCV 2020. The contest requires submitting the same model to seven benchmarks from three different domains. Our approach is based on the SwiftNet architecture with pyramidal fusion. We address inconsistent taxonomies with a single-level 193-dimensional softmax output. We strive to train with large batches in order to stabilize optimization of a hard recognition problem, and to favour smooth evolution of batchnorm statistics. We achieve this by implementing a custom backward step through log-sum-prob loss, and by using small crops before freezing the population statistics. Our model ranks first on the RVC semantic segmentation challenge as well as on the WildDash 2 leaderboard. This suggests that pyramidal fusion is competitive not only for efficient inference with lightweight backbones, but also in large-scale setups for multi-domain application.

研究の動機と目的

  • 異なるクラスラベルと分布を持つ複数の意味セグメンテーションデータセットに一般化可能な単一のディープラーニングモデルの開発。
  • ADE20K、Cityscapes、VIPER、ScanNetなどのデータセットにおけるドメインシフトとクラス曖昧性の解決。
  • 特にレアクラスや重複クラスの状況において、分布外(OOD)データでの性能向上。
  • 境界誤差やクラス重複に対するモデルの堅牢性を高める損失関数の設計。
  • マルチスケール表現間の有効な特徴統合を可能にし、セグメンテーション精度の向上。

提案手法

  • モデルは、マルチスケールの文脈的表現を統合するために、ピラミッド特徴統合を用いたSwiftNet ResNet-152バックボーンを採用。
  • 複数のデータセット間で重複するか部分集合であるクラスを統合・抽象化・分割することで、共通の意味空間を構築するためのユニバーサルラベルセットを構築。
  • 提案されたlog-sum-prob損失は、負の対数尤度と、予測信頼度および境界認識性に基づく指数的重み付けを組み合わせる。
  • 損失関数は動的重み付け方式を採用:$ L^{ij} = -\alpha^{ij} e^{\gamma(1-p^{ij})} \log p^{ij} $、ここで $ p^{ij} $ はピクセル $ (i,j) $ についてのユニバーサルクラス全体の確率の合計。
  • クラスレベルでの統合と分割を適用して矛盾を解消:完全一致は統合、部分集合は抽象化、重複クラスは互いに排他的な成分に分解。
  • トレーニングにはデータオーグメンテーション(水平反転、スケールジッタリング、クロップ)、コサインアニーリングを用いたAdam最適化、6× V100 GPUでの勾配蓄積を用いる。

実験結果

リサーチクエスチョン

  • RQ1一貫性のないクラスラベルを持つ複数の多様な意味セグメンテーションデータセットで、強力な性能を発揮できる単一のディープラーニングモデルは構築可能か?
  • RQ2部分集合や重複クラスのようなクラスレベルの矛盾は、どのように解消され、マルチドメイン意味セグメンテーションを統一できるか?
  • RQ3境界認識型でlog-sum-prob損失が、分布外データにおけるセグメンテーションの堅牢性をどの程度向上させるか?
  • RQ4ピラミッド特徴統合は、マルチスケールの文脈統合を強化し、クロスドメイン設定での一般化を向上させるか?
  • RQ5モデルは、WildDash 2 や WDv2 などのOODシナリオにおけるレアクラスや曖昧クラスにおいて、どの程度の性能を示すか?

主な発見

  • VIPERデータセットでは62.5%のmIoUを達成し、同ベンチマークで前回の最先端(40.7%)を著しく上回った。
  • WildDash 2では45.4%のmIoUを達成し、次善の手法(37.9%)を7.5ポイント以上上回った。
  • MVD(455億ピクセル)においては、誤分類ピクセルが0.04%にとどまり、高いOOD一般化性能を示した。
  • ScanNetでは54.6%のmIoUを達成し、ベースラインのMSeg1080_RVC比で6.1%の向上を示した。
  • 推論速度も高く、初期トレーニング段階で384×384入力解像度で45 FPSを達成した。
  • 損失関数は境界領域の誤りを効果的に低減しており、WildDash 2の負のピクセルにおいて32.5%のIoUを示し、曖昧または稀なクラスの処理が改善されたことを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。