Skip to main content
QUICK REVIEW

[論文レビュー] Integrative Few-Shot Learning for Classification and Segmentation

Dahyun Kang, Minsu Cho|arXiv (Cornell University)|Mar 29, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

本稿では、少数のサポート例を用いてクラス存在とフォアグラウンドマスクを同時に予測する統合的少数ショット学習(iFSL)を、少数ショット分類とセグメンテーション(FS-CS)のための統一されたタスクとして導入する。提案された注意メカニズムを備えたスリミングネットワーク(ASNet)は、意味的相関とグローバル自己注意機構を活用して、正確でクラスに依存するフォアグラウンドマップを生成し、FS-CSおよび標準的な少数ショットセグメンテーションベンチマークの両方で最先端の性能を達成している。

ABSTRACT

We introduce the integrative task of few-shot classification and segmentation (FS-CS) that aims to both classify and segment target objects in a query image when the target classes are given with a few examples. This task combines two conventional few-shot learning problems, few-shot classification and segmentation. FS-CS generalizes them to more realistic episodes with arbitrary image pairs, where each target class may or may not be present in the query. To address the task, we propose the integrative few-shot learning (iFSL) framework for FS-CS, which trains a learner to construct class-wise foreground maps for multi-label classification and pixel-wise segmentation. We also develop an effective iFSL model, attentive squeeze network (ASNet), that leverages deep semantic correlation and global self-attention to produce reliable foreground maps. In experiments, the proposed method shows promising performance on the FS-CS task and also achieves the state of the art on standard few-shot segmentation benchmarks.

研究の動機と目的

  • 従来の少数ショット学習の限界を克服し、分類とセグメンテーションを1つのより現実的なタスクに統合すること。
  • 複数ラベルおよびバックグラウンドに配慮した予測を処理するフレームワークの開発、特にクエリにターゲットクラスが存在しない場合を含む。
  • 共有表現学習を通じて信頼性が高く、クラスごとのフォアグラウンドマップを生成できるモデルの設計。
  • 極めて小さなオブジェクト、顕著でないオブジェクト、または複数のオブジェクトが含まれるような状況における少数ショットシナリオにおける汎化性とロバストネスの向上。
  • FS-CSモデルの転移学習による、標準的な少数ショット分類(FS-C)およびセグメンテーション(FS-S)タスクへの適用可能性の検証。

提案手法

  • 分類とセグメンテーションの両タスク間でクラスごとのフォアグラウンドマップを共有することで、両タスクに同時に学習するiFSLフレームワークを提案。
  • クエリとサポートの特徴間の意味的相関テンソルを計算する、注意メカニズムを備えたスリミングネットワーク(ASNet)を設計。
  • ストライド付きグローバル自己注意機構を用いて、相関テンソルを高精度なフォアグラウンドマップに変換。
  • 複数レベルの特徴表現を用いることで、意味的理解と空間的局在化を強化。
  • 分類タグとセグメンテーションアノテーションの両方を用いて、エンドツーエンドでモデルを訓練し、共同最適化を実現。
  • 二重ヘッド予測ヘッドを採用し、バイナリクラス存在とピクセル単位のセグメンテーションマスクの両方を予測。

実験結果

リサーチクエスチョン

  • RQ1現実的な状況(ターゲットクラスが存在しない、または複数存在する)下で、統合的少数ショット学習フレームワークが分類とセグメンテーションを効果的に統合できるか。
  • RQ2分類とセグメンテーションを統合することで、独立したタスク学習に比べて、ロバストネスと精度がどの程度向上するか。
  • RQ3提案されたASNetモデルが、標準的な少数ショットセグメンテーションベンチマークにどの程度一般化可能か。
  • RQ4統合的FS-CSタスクで学習したモデルが、転移学習を通じて下流のFS-CおよびFS-Sタスクで性能向上を達成できるか。
  • RQ5グローバル自己注意機構と意味的相関の統合が、挑戦的な少数ショットシナリオにおけるフォアグラウンドマップ品質をどの程度向上させるか。

主な発見

  • ASNetは、ResNet50を用いた1-way 1-shot COCO-20iで、42.2%のmIoUおよび42.2%の分類正確率を達成し、提案されたFS-CSベンチマークで最先端性能を示した。
  • 1-way 5-shotでは、mIoUが47.9%、分類正確率が47.9%を達成し、両指標で先行手法を上回った。
  • ResNet101を用いた1-way 1-shotでは、mIoUが49.5%、分類正確率が49.5%を達成し、優れた一般化性能を示した。
  • 標準的な少数ショットセグメンテーションベンチマークにおいて、HSNet や CMN などの既存のFS-Sモデルを大きく上回り、ResNet101を用いた1-way 5-shotで72.7%のFBIoUを達成した。
  • 定性的な結果から、ASNetは、極めて小さなオブジェクト、顕著でないオブジェクト、あるいは存在しないオブジェクトに対しても正しくターゲットをセグメンテーションできることを示した。一方、標準的なFS-Sモデルは、関係のない顕著なオブジェクトを誤ってセグメンテーションしてしまう。
  • 転移学習の実験から、FS-CSで学習したモデルが、FS-CおよびFS-Sタスクの両方に対して効果的に一般化できることを確認し、タスク間の転移可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。