Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Dataset Collaborative Learning for Semantic Segmentation.

Li Wang, Dong Li|arXiv (Cornell University)|Mar 21, 2021
Advanced Neural Network Applications参考文献 24被引用数 5
ひとこと要約

本稿では、データセット別ブロック(DABs)とデータセット入れ替え学習(DAT)を用いて複数のデータセットで訓練することで、セマンティックセグメンテーションの一般化性能を向上させる、クロスデータセット協調学習(CDCL)を提案する。追加のFLOPsを要せず、シティスケープ、BDD100K、CamVidでそれぞれ5.65%、6.57%、5.79%のmIoU向上を達成し、単一データセットベースラインを上回る最先端の性能を実現する。

ABSTRACT

Recent work attempts to improve semantic segmentation performance by exploring well-designed architectures on a target dataset. However, it remains challenging to build a unified system that simultaneously learns from various datasets due to the inherent distribution shift across different datasets. In this paper, we present a simple, flexible, and general method for semantic segmentation, termed Cross-Dataset Collaborative Learning (CDCL). Given multiple labeled datasets, we aim to improve the generalization and discrimination of feature representations on each dataset. Specifically, we first introduce a family of Dataset-Aware Blocks (DAB) as the fundamental computing units of the network, which help capture homogeneous representations and heterogeneous statistics across different datasets. Second, we propose a Dataset Alternation Training (DAT) mechanism to efficiently facilitate the optimization procedure. We conduct extensive evaluations on four diverse datasets, i.e., Cityscapes, BDD100K, CamVid, and COCO Stuff, with single-dataset and cross-dataset settings. Experimental results demonstrate our method consistently achieves notable improvements over prior single-dataset and cross-dataset training methods without introducing extra FLOPs. Particularly, with the same architecture of PSPNet (ResNet-18), our method outperforms the single-dataset baseline by 5.65\%, 6.57\%, and 5.79\% of mIoU on the validation sets of Cityscapes, BDD100K, CamVid, respectively. Code and models will be released.

研究の動機と目的

  • 多様なセマンティックセグメンテーションデータセット間での分布シフトの課題に対処すること。
  • 複数のデータセット間で特徴表現の一般化と区別能を向上させること。
  • 計算コストの増加なしに、複数のラベル付きデータセットを効果的に活用できる柔軟で統一的なトレーニングフレームワークを構築すること。
  • アーキテクチャの変更なしに、多様なデータセットで一貫した性能向上を実現すること。

提案手法

  • データセットに依存する統計と非依存の統計の両方を捉える学習可能なユニットとして、データセット別ブロック(DABs)を導入する。
  • 最適化中にデータセットを入れ替えながら学習するデータセット入れ替え学習(DAT)戦略を設計し、収束性と特徴の多様性を向上させる。
  • DABsを複数の段階に挿入した共有バックボーンネットワーク(例:ResNet-18を搭載したPSPNet)を採用し、データセット固有の統計に適応する。
  • 各トレーニングステップで異なるデータセットからサンプリングするマルチデータセットトレーニングスケジュールを採用し、クロスデータセット間の知識移行を可能にする。
  • 追加のFLOPsを一切追加しないようにし、パラメータ効率の良いDABモジュールのみを追加することで、推論効率を維持する。
  • 追加の正則化や補助ヘッドを用いず、標準的なセグメンテーション損失を用いてエンドツーエンドでモデルを最適化する。

実験結果

リサーチクエスチョン

  • RQ1複数のデータセットで訓練した統一モデルは、単一データセット学習と比較して、セマンティックセグメンテーションの一般化性能を向上させることができるか?
  • RQ2顕著なドメインシフトを示すデータセットから効果的に学習しつつ、効率性を維持できるか?
  • RQ3FLOPsを増加させずに、効果的なクロスデータセット間の知識移行を可能にするアーキテクチャ的要素は何か?
  • RQ4トレーニング中にデータセットを入れ替えることで、特徴の区別能と一般化性能が向上するか?
  • RQ5提案手法は、多様なベンチマークで既存の単一および複数データセット学習手法を上回ることができるか?

主な発見

  • CDCLは、単一データセットベースライン(PSPNet(ResNet-18))と比較して、Cityscapesで5.65%のmIoU向上を達成した。
  • BDD100Kでは6.57%のmIoU向上を達成し、多様な都市ドライブシーンへの強い一般化性能を示した。
  • CamVidでは5.79%のmIoU向上を達成し、解像度やアノテーション品質が異なるデータセットに対しても堅牢であることを確認した。
  • 性能向上は、Cityscapes、BDD100K、CamVid、COCO Stuffの4つの評価済みデータセットすべてで一貫して見られた。
  • 追加のFLOPsを一切導入せず、推論効率を維持したまま、これらの向上を達成した。
  • アブレーションスタディにより、DABsとDATの両方が性能向上に不可欠であることが確認され、いずれかのコンponentを除去するとmIoUが著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。