[논문 리뷰] Mask-guided Vision Transformer (MG-ViT) for Few-Shot Learning
이 논문은 사전 훈련된 비전 트랜스포머(Vision Transformer, ViT)의 성능을 향상시키기 위해 기울기 가중 카테고리 활성 맵(Grad-CAM)을 기반으로 한 패치 마스크를 적용하는 새로운 소수학습(few-shot learning) 프레임워크인 마스크 유도 비전 트랜스포머(Mask-guided Vision Transformer, MG-ViT)를 제안한다. 이는 작업에 관련된 분류 가능한 이미지 패치에 집중하면서도 잔류 연결(residual connection)을 통해 전반적인 맥락을 유지한다. MG-ViT는 이미지 분류 및 객체 검출 벤치마크에서 최신 기술 수준의 성능을 달성하며, 추가적인 사전 훈련 비용 없이 효율적인 지식 일반화를 통해 표준 미세조정보다 10샷 검출에서 최대 9.1% 향상되고 10샷 분류에서 최대 1.9% 향상된다.
Learning with little data is challenging but often inevitable in various application scenarios where the labeled data is limited and costly. Recently, few-shot learning (FSL) gained increasing attention because of its generalizability of prior knowledge to new tasks that contain only a few samples. However, for data-intensive models such as vision transformer (ViT), current fine-tuning based FSL approaches are inefficient in knowledge generalization and thus degenerate the downstream task performances. In this paper, we propose a novel mask-guided vision transformer (MG-ViT) to achieve an effective and efficient FSL on ViT model. The key idea is to apply a mask on image patches to screen out the task-irrelevant ones and to guide the ViT to focus on task-relevant and discriminative patches during FSL. Particularly, MG-ViT only introduces an additional mask operation and a residual connection, enabling the inheritance of parameters from pre-trained ViT without any other cost. To optimally select representative few-shot samples, we also include an active learning based sample selection method to further improve the generalizability of MG-ViT based FSL. We evaluate the proposed MG-ViT on both Agri-ImageNet classification task and ACFR apple detection task with gradient-weighted class activation mapping (Grad-CAM) as the mask. The experimental results show that the MG-ViT model significantly improves the performance when compared with general fine-tuning based ViT models, providing novel insights and a concrete approach towards generalizing data-intensive and large-scale deep learning models for FSL.
연구 동기 및 목표
- 데이터 집약적인 비전 트랜스포머(ViT)에서 소수학습(FSL)을 위한 지식 일반화의 비효율성을 해결하기 위해.
- 소수학습 기간 동안 ViT가 작업에 관련된 분류 가능한 이미지 패치에 집중하도록 하는 마스크 연산을 도입하여 배경 콘텐츠를 억제하기 위해.
- 마스킹으로 인해 손실된 전반적인 공간적 및 위치 정보를 첫 번째 및 마지막 인코더 레이어 간의 잔류 연결을 통해 유지하기 위해.
- 대표적인 소수학습 샘플을 식별하는 활성 학습 기반 샘플 선택 방법을 통합하여 모델 일반화를 향상시키기 위해.
- 저자료 환경에서 다양한 후행 작업, 즉 이미지 분류 및 객체 검출을 포함한 MG-ViT의 효과성을 입증하기 위해.
제안 방법
- 기본 데이터셋에서 가장 분류 가능한 작업에 관련된 이미지 패치를 식별하기 위해 기울기 가중 카테고리 활성 맵(Grad-CAM) 기반의 선명도 맵을 적용한다.
- 첫 번째 ViT 인코더 레이어 이전에 학습 가능한 마스크를 적용하여 관련 없는 패치를 억제함으로써 소수학습 기간 동안 고선명 영역에 집중할 수 있도록 한다.
- 마스킹으로 인해 손실된 전반적인 공간적 및 위치적 맥락을 첫 번째 및 마지막 ViT 인코더 레이어 간의 잔류 연결을 통해 유지한다.
- 두 단계 훈련 기반: 기본 데이터셋에서 표준 ViT로 사전 훈련한 후, MG-ViT를 사용하여 기본 클래스와 새로운 클래스 모두에서 미세조정한다.
- 클러스터 기반 활성 학습 방법을 도입하여 대표적인 소수학습 샘플을 선택함으로써, 미표기된 데이터에 대한 모델 일반화 및 성능을 향상시킨다.
- 이질적인 작업에서 전반적 의미(이산형)와 객체 윤곽 정확도(연속형) 사이의 상충 관계를 탐색하기 위해 이산형 및 연속형 마스크 형태를 사용한다.
실험 결과
연구 질문
- RQ1작업에 관련된 분류 가능한 이미지 패치에 집중함으로써 패치 수준의 마스크 연산이 비전 트랜스포머에서 소수학습 성능을 향상시킬 수 있는가?
- RQ2마스킹으로 인해 부분적으로 손실된 전반적인 공간 정보가 있을 때 인코더 레이어 간의 잔류 연결이 성능에 어떤 영향을 미치는가?
- RQ3활성 학습 기반 샘플 선택은 무작위 샘플링 대비 소수학습에서 더 나은 일반화를 이끌어내는가?
- RQ4이산형과 연속형 마스크 유형 간의 성능 차이는 이미지 분류와 객체 검출 작업에서 어떻게 영향을 미치는가?
- RQ5추가적인 사전 훈련이나 아키텍처의 대대적 개선 없이 MG-ViT는 다양한 후행 작업, 즉 이미지 분류 및 객체 검출에 효과적으로 일반화될 수 있는가?
주요 결과
- MG-ViT는 표준 미세조정 대비 5샷에서 2.7% 향상(50.6% 대 47.9%), 10샷에서 9.1% 향상(65.3% 대 56.2%), 30샷에서 1.1% 향상(76.0% 대 74.9%)하여 소수학습 객체 검출 성능을 향상시켰다.
- 이미지 분류에서는 1샷에서 85.6%의 정확도, 5샷에서 98.1%, 10샷에서 98.5%를 기록하여 표준 미세조정 대비 최대 1.9% 향상되었다.
- 활성 학습 기반 샘플 선택은 10샷 이미지 분류 정확도를 1.9% 향상시켰다(96.6%에서 98.5%로), 10샷 검출 mAP는 9.0% 향상시켰다(56.3%에서 65.3%로).
- 이웃 샘플 식별은 5샷 이미지 분류 정확도를 7.4% 향상시켰다(90.4%에서 97.8%로), 30샷 검출 mAP는 2.4% 향상시켰다(72.9%에서 75.3%로).
- 이산형 마스크는 이미지 분류에서 더 우수한 성능(5샷에서 98.7%)을 보였고, 연속형 마스크는 객체 검출에서 뛰어난 성능(10샷에서 65.3%)을 보였다. 이는 작업에 따라 마스크 설계가 유리함을 시사한다.
- 마스크 유도, 잔류 연결, 활성 학습의 조합은 추가적인 사전 훈련 없이 사전 훈련된 ViT 가중치를 그대로 유지하면서도 최신 기술 수준의 성능을 달성하며, 아키텍처 수정 최소화로도 효과적인 성능 향상을 이룬다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.