[論文レビュー] Few-Shot Panoptic Segmentation With Foundation Models
本論文は、10枚のアノテート済み画像のみを用いて、固定されたDINOv2バックボーンを活用して高品質な偽ラベルを生成する、少数ショット・パンセグメンテーション手法SPINOを提案する。これらの少数のラベルで軽量なヘッドを訓練することで、セマンティックセグメンテーションおよび境界推定用のヘッドを学習し、完全教師あり手法に匹敵する品質の偽ラベルを生成する。Cityscapesで0.29%の訓練ラベルのみを用いて35.9のPQを達成する。
Current state-of-the-art methods for panoptic segmentation require an immense amount of annotated training data that is both arduous and expensive to obtain posing a significant challenge for their widespread adoption. Concurrently, recent breakthroughs in visual representation learning have sparked a paradigm shift leading to the advent of large foundation models that can be trained with completely unlabeled images. In this work, we propose to leverage such task-agnostic image features to enable few-shot panoptic segmentation by presenting Segmenting Panoptic Information with Nearly 0 labels (SPINO). In detail, our method combines a DINOv2 backbone with lightweight network heads for semantic segmentation and boundary estimation. We show that our approach, albeit being trained with only ten annotated images, predicts high-quality pseudo-labels that can be used with any existing panoptic segmentation method. Notably, we demonstrate that SPINO achieves competitive results compared to fully supervised baselines while using less than 0.3% of the ground truth labels, paving the way for learning complex visual recognition tasks leveraging foundation models. To illustrate its general applicability, we further deploy SPINO on real-world robotic vision systems for both outdoor and indoor environments. To foster future research, we make the code and trained models publicly available at http://spino.cs.uni-freiburg.de.
研究の動機と目的
- 大規模な人手によるアノテートデータセットに依存するパンセグメンテーションの高コストなアノテーションを低減すること。
- タスクに依存しないフォーチュンモデルが、パンセグメンテーションにおける少数ショット学習を可能にするかを調査すること。
- 下流のパンセグメンテーションのための最小限の監視のもとで、高品質な偽ラベルを生成する手法を開発すること。
- ロボティクス分野におけるリアルワールドでのパンセグメンテーションの実用的導入を可能にし、アノテーションの負荷を最小限に抑えること。
- 今後の少数ショット視覚認識分野の研究を支援するため、公開可能なフレームワークを提供すること。
提案手法
- 未ラベル画像から自己教師的・タスクに依存しない視覚特徴を抽出するために、固定されたDINOv2バックボーンを活用する。
- 10枚のアノテート済み画像のみを用いて、セマンティックセグメンテーション用および境界推定用の2つの軽量でヘッド特化のネットワークを訓練する。
- より大きな未ラベル画像のセットに対して、事前に訓練されたヘッドを用いてオフラインでパンセグメンテーション偽ラベルを生成する。
- データオーグメンテーション(ランダムクロップ、カラーのジャマーリング)およびテスト時オーグメンテーション(マルチスケールアンサンブル)を適用して、偽ラベルの品質を向上させる。
- MLPを用いたマルチヘッドアーキテクチャを採用し、特徴の精錬を実現。k-NN、線形層、4層のCNNと比較して、偽ラベル生成において優れた性能を示す。
- 最適な偽ラベル品質を得るためにバッチサイズを1に設定し、学習率を比例的にスケーリングする。
実験結果
リサーチクエスチョン
- RQ1DINOv2のようなフォーチュンモデルが、人手によるアノテーションデータを最小限に抑えつつ、少数ショットパンセグメンテーションを可能にするか。
- RQ210枚のラベル付き画像からのみ生成された偽ラベルの品質は、完全教師ありベースラインと比べてどの程度か。
- RQ3低ショット設定における偽ラベル品質を最大化するために、どのようなアーキテクチャ選択と訓練戦略が有効か。
- RQ4生成された偽ラベルは、既存のあらゆるパンセグメンテーションモデルの訓練に効果的に利用できるか。
- RQ5本手法は、多様なリアルワールド環境やデータセットに一般化可能か。
主な発見
- SPINOは、10枚のラベル付き画像のみを用いて、Cityscapesで35.9のパノプティック品質(PQ)を達成し、全訓練セットの0.29%に相当する。
- 100枚のラベル付き画像を用いることで、SPINOはPQ 42.9に到達し、完全教師ありResNet-50ベースライン(PQ 43.5)に近い性能を示す。
- テスト時マルチスケールアンサンブル推論により、標準的な推論と比較してPQが10.6ポイント向上し、アンサンブル予測の有効性を示している。
- k-NN、線形層、4層CNNと比較して、SPINOは偽ラベル生成において優れた性能を示し、MLPが最も強い性能を発揮した。
- SPINOが生成する偽ラベルは、CityscapesやKITTI-360といった公開データセット、および屋外・屋内環境を含む自社のロボティクス分野の実世界データセットにおいても、競争力のある結果をもたらした。
- アブレーションスタディにより、ラベル付き画像の枚数を1枚から100枚に増やすことで、mIoU、PQ、RQが継続的に向上することが確認されたが、100枚を超えると効果の逓減が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。