[論文レビュー] Cross-domain Few-shot Segmentation with Transductive Fine-tuning
本論文は、サポートラベルを用いてラベルなしクエリ画像を暗黙的に監視することで、プロトタイプFSSモデルの性能を向上させる、クロスドメイン少数ショットセグメンテーションのための伝達的微調整手法を提案する。クラスごとのプロトタイプを不確実性を考慮した対照的損失を用いてアライメントさせ、教師あり損失および境界正則化を組み合わせることで、自然画像、リモートセンシング画像、医療画像の間でドメインギャップを効果的に埋め、追加のアノテーションなしで顕著に性能を向上させる。
Few-shot segmentation (FSS) expects models trained on base classes to work on novel classes with the help of a few support images. However, when there exists a domain gap between the base and novel classes, the state-of-the-art FSS methods may even fail to segment simple objects. To improve their performance on unseen domains, we propose to transductively fine-tune the base model on a set of query images under the few-shot setting, where the core idea is to implicitly guide the segmentation of query images using support labels. Although different images are not directly comparable, their class-wise prototypes are desired to be aligned in the feature space. By aligning query and support prototypes with an uncertainty-aware contrastive loss, and using a supervised cross-entropy loss and an unsupervised boundary loss as regularizations, our method could generalize the base model to the target domain without additional labels. We conduct extensive experiments under various cross-domain settings of natural, remote sensing, and medical images. The results show that our method could consistently and significantly improve the performance of prototypical FSS models in all cross-domain tasks.
研究の動機と目的
- ベース学習データとは異なるドメインからの新しいクラスが登場する場合に、少数ショットセグメンテーションモデルの性能が低下することを解決する。
- 適応プロセスにラベルなしクエリ画像を組み込むことで、少数ショット微調整における過学習を克服する。
- サポートラベルからの暗黙的監視を用いて、未学習ドメインへのプロトタイプFSSモデルの一般化性能を向上させる。
- ラベル付きサポート画像とラベルなしクエリ画像の両方を活用する半教師あり微調整戦略を開発し、ドメイン間で特徴プロトタイプをアライメントする。
- 自然画像、リモートセンシング画像、医療画像を含む多様なドメインにおいて、本手法の有効性を検証する。
提案手法
- 伝達的設定において、ラベル付き(サポート)画像とラベルなし(クエリ)画像の組み合わせを用いて、事前学習済みのプロトタイプFSSモデルを微調整する。
- ベースモデルを用いて特徴を抽出し、特徴空間におけるクラスタリングにより細分化されたプロトタイプを生成する。
- クラスごとの表現を対比することで、クエリとサポートのプロトタイプをアライメントする不確実性を考慮した対照的損失を導入する。
- 不確実性要因を用いて損失重みを動的に調整し、ノイズが多いまたは曖昧なクエリプロトタイプの影響を低減する。
- サポート画像に対して教師ありクロスエントロピー損失を適用し、クエリマスクに対して非教師あり境界損失を適用してセグメンテーション品質を正則化する。
- 対照的損失、クロスエントロピー損失、境界損失を組み合わせたマルチオブジェクティブ損失を最適化することで、安定的かつ効果的な適応を実現する。
実験結果
リサーチクエスチョン
- RQ1ベースクラスと新規クラスの間にドメインシフトが生じる状況でも、伝達的微調整が少数ショットセグメンテーションの性能を向上させることができるか?
- RQ2サポートラベルからの暗黙的監視が、微調整中におけるラベルなしクエリ画像のセグメンテーションをどれほど効果的に導けるか?
- RQ3不確実性を考慮したプロトタイプアライメントは、クロスドメイン少数ショットセグメンテーションにおけるロバストネスと一般化性能を向上させるか?
- RQ4標準的な微調整法や他の伝達的手法と比較して、本手法はクロスドメインFSSベンチマークでどれほど優れているか?
- RQ5実世界の少数ショットセグメンテーションシナリオにおいて、サポート画像の選択が本手法の性能に与える影響は何か?
主な発見
- 提案手法は、自然画像、リモートセンシング画像、医療画像を含むすべてのテストされたクロスドメイン設定において、プロトタイプFSSモデルの性能を顕著に向上させる。
- PASCAL-5iベンチマークでは、ResNet-50特徴空間におけるクラスタ中心として代表的なサポート画像を選択した場合、平均IoUが61.2%に達する。
- サポート画像の選択に応じて性能に大きな差が生じ、最良の画像を用いた場合と最悪の画像を用いた場合とで、全クラス平均で最大49.4%のIoU差が生じる。
- 深層特徴空間におけるクラスタ中心を代表サポート画像として使用すると、ランダムに選択した画像を使用する場合に比べて平均IoUが4.9%向上する。
- クロスドメイン少数ショットセグメンテーションタスクにおいて、本手法は標準的な教師あり微調整法および他の伝達的ベースラインを一貫して上回る。
- 不確実性を考慮した対照的損失は、ノイズが多いまたは曖昧なクエリプロトタイプの影響を効果的に低減し、モデルの安定性と一般化性能を向上させる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。