[論文レビュー] Mask-guided Vision Transformer (MG-ViT) for Few-Shot Learning
本稿では、勾配重み付きクラス活性化マッピング(Grad-CAM)ガイド付きパッチマスクを用いて、タスク関連で特徴的な画像パッチに注目し、残差接続によるグローバルなコンテキストを保持することで、事前学習済みビジョントランスフォーマー(ViT)の性能を向上させる、新しい少サンプル学習フレームワークであるマスクガイドドビジョントランスフォーマー(MG-ViT)を提案する。MG-ViTは、追加の事前学習コストなしに、効率的な知識一般化を実現することで、画像分類およびオブジェクト検出ベンチマークの両方で最先端の性能を達成し、10ショット検出では標準的微調整より最大9.1%、10ショット分類では1.9%の向上を達成した。
Learning with little data is challenging but often inevitable in various application scenarios where the labeled data is limited and costly. Recently, few-shot learning (FSL) gained increasing attention because of its generalizability of prior knowledge to new tasks that contain only a few samples. However, for data-intensive models such as vision transformer (ViT), current fine-tuning based FSL approaches are inefficient in knowledge generalization and thus degenerate the downstream task performances. In this paper, we propose a novel mask-guided vision transformer (MG-ViT) to achieve an effective and efficient FSL on ViT model. The key idea is to apply a mask on image patches to screen out the task-irrelevant ones and to guide the ViT to focus on task-relevant and discriminative patches during FSL. Particularly, MG-ViT only introduces an additional mask operation and a residual connection, enabling the inheritance of parameters from pre-trained ViT without any other cost. To optimally select representative few-shot samples, we also include an active learning based sample selection method to further improve the generalizability of MG-ViT based FSL. We evaluate the proposed MG-ViT on both Agri-ImageNet classification task and ACFR apple detection task with gradient-weighted class activation mapping (Grad-CAM) as the mask. The experimental results show that the MG-ViT model significantly improves the performance when compared with general fine-tuning based ViT models, providing novel insights and a concrete approach towards generalizing data-intensive and large-scale deep learning models for FSL.
研究の動機と目的
- データ集約型ビジョントランスフォーマー(ViT)における少サンプル学習(FSL)のための標準的微調整の非効率性を是正すること。
- 不要な背景コンテンツを抑えるマスク操作を導入することで、FSL中にViTがタスク関連で特徴的な画像パッチに注目できるようにすること。
- マスキングによって失われるグローバルな空間的および位置情報の保持のため、最初のおよび最後のエンコーダー層間に残差接続を導入すること。
- 代表的な少サンプルサンプルを特定するアクティブラーニングベースのサンプル選択法を統合することで、モデルの一般化性能を向上させること。
- 画像分類およびオブジェクト検出を含む多様な下流タスクにおいて、低データ環境下でもMG-ViTの有効性を示すこと。
提案手法
- ソースデータセットから、タスク関連で特徴的で、最も顕著なパッチを特定するために、Grad-CAMベースのサリエンシーマップを適用する。
- 最初のViTエンコーダー層の前に、学習可能なマスクを適用して非関連パッチを抑制し、FSL中に高サリエンシー領域に注目できるようにする。
- マスキングによって失われるグローバルな空間的および位置的コンテキストを保持するために、最初のおよび最後のViTエンコーダー層間に残差接続を導入する。
- 2段階の訓練スキームを採用する:ベースデータセットでヴァニラViTで事前学習し、その後、ベースクラスおよび新規クラスの両方でMG-ViTで微調整する。
- クラスタリングベースのアクティブラーニング手法を統合して、代表的な少サンプルサンプルを選択し、未ラベルデータに対するモデルの一般化性能と性能を向上させる。
- 離散的および連続的マスク形状を用いて、異なるタスクにおけるグローバル意味(離散的)とオブジェクトの輪郭の正確さ(連続的)のトレードオフを調査する。
実験結果
リサーチクエスチョン
- RQ1タスク関連で特徴的な画像パッチに注目することで、パッチレベルのマスク操作がビジョントランスフォーマーにおける少サンプル学習性能を向上させることができるか?
- RQ2マスキングによって部分的に失われるグローバルな空間的情報に対して、エンコーダー層間の残差接続が性能に与える影響は何か?
- RQ3アクティブラーニングベースのサンプル選択は、ランダムサンプリングと比較して、少サンプル学習における一般化性能を向上させるか?
- RQ4離散的と連続的の異なるマスクタイプは、画像分類とオブジェクト検出タスクにおける性能にどのように影響を与えるか?
- RQ5MG-ViTは、追加の事前学習やアーキテクチャの大幅な変更なしに、画像分類やオブジェクト検出を含む多様な下流タスクに効果的に一般化できるか?
主な発見
- オブジェクト検出において、MG-ViTは5ショットで2.7%(50.6% 対 47.9%)、10ショットで9.1%(65.3% 対 56.2%)、30ショットで1.1%(76.0% 対 74.9%)の向上を、標準的微調整を超えて達成した。
- 画像分類において、MG-ViTは1ショットで85.6%、5ショットで98.1%、10ショットで98.5%の精度を達成し、標準的微調整を最大1.9%上回った。
- アクティブラーニングベースのサンプル選択により、10ショット画像分類の精度が1.9%(96.6% から 98.5%)向上し、10ショット検出のmAPが9.0%(56.3% から 65.3%)向上した。
- 近隣サンプル同定により、5ショット画像分類の精度が7.4%(90.4% から 97.8%)向上し、30ショット検出のmAPが2.4%(72.9% から 75.3%)向上した。
- 離散的マスクは画像分類で優れた性能(5ショットで98.7%)を示したが、連続的マスクはオブジェクト検出で優れた結果(10ショットで65.3%)を示し、タスクに応じたマスク設計の利点を示した。
- マスクガイド、残差接続、アクティブラーニングの組み合わせにより、MG-ViTは追加の事前学習なしに事前学習済みViT重みを引き継ぎ、最小限のアーキテクチャ変更で最先端の性能を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。