[논문 리뷰] Sparse Spatial Transformers for Few-Shot Learning
이 논문은 소수 샘플 학습을 위한 새로운 트랜스포머 기반 아키텍처인 스파스 스페이셜 트랜스포머(SSFormers)를 제안한다. 이는 밀집된 국소 이미지 패치를 추출하고, 쿼리 및 서포트 이미지 간에 임무에 관련된 패치를 선택하기 위해 스파스 스페이셜 트랜스포머 레이어를 사용하며, 유사도 계산을 위해 패치 매칭 모듈을 활용함으로써 특징 표현을 향상시킨다. 이 방법은 임무별 맥락을 공동으로 모델링하고 관련 없는 특징을 억제함으로써 소수 샘플 학습 벤치마크에서 최신 기술 수준의 성능을 달성한다.
Learning from limited data is challenging because data scarcity leads to a poor generalization of the trained model. A classical global pooled representation will probably lose useful local information. Many few-shot learning methods have recently addressed this challenge using deep descriptors and learning a pixel-level metric. However, using deep descriptors as feature representations may lose image contextual information. Moreover, most of these methods independently address each class in the support set, which cannot sufficiently use discriminative information and task-specific embeddings. In this paper, we propose a novel transformer-based neural network architecture called sparse spatial transformers (SSFormers), which finds task-relevant features and suppresses task-irrelevant features. Particularly, we first divide each input image into several image patches of different sizes to obtain dense local features. These features retain contextual information while expressing local information. Then, a sparse spatial transformer layer is proposed to find spatial correspondence between the query image and the full support set to select task-relevant image patches and suppress task-irrelevant image patches. Finally, we propose using an image patch-matching module to calculate the distance between dense local representations, thus determining which category the query image belongs to in the support set. Extensive experiments on popular few-shot learning benchmarks demonstrate the superiority of our method over state-of-the-art methods. Our source code is available at \url{https://github.com/chenhaoxing/ssformers}.
연구 동기 및 목표
- 전역 특징과 딥 디스크립터의 한계를 해결하기 위해, 소수 샘플 학습에서 국소적 또는 맥락 정보를 손실하는 문제를 해결한다.
- 기존 메트릭 학습 방법에서 개별 클래스 처리의 비효율성을 극복하기 위해, 임무 수준의 맥락을 활용한다.
- 쿼리 및 서포트 이미지 간에 임무에 관련된 이미지 패치를 식별하고 강조할 수 있는 메커니즘을 개발한다.
- 쿼리 및 서포트 이미지 간의 공간 대응을 이용해 임무 특화 프로토타입을 생성하여 특징의 구분 능력을 향상시킨다.
- 기본 코사인 유사도보다 더 효과적으로 패치 수준의 유사도를 계산할 수 있는 패치 매칭 모듈을 설계한다.
제안 방법
- 입력 이미지를 다양한 크기의 이미지 패치로 나누어 맥락 정보를 유지하면서도 밀집된 국소 특징을 추출한다.
- 쿼리 패치와 전체 서포트 세트 간의 공간 대응을 찾기 위해 교차 어텐션을 사용하는 스파스 스페이셜 트랜스포머 레이어(SSTL)를 도입하여, 임무에 관련된 패치를 선택하고 관련 없는 패치를 억제한다.
- 서포트 세트 특징과 강한 상관관계를 가지는 쿼리 패치를 식별하기 위해 상호 최근접 이웃 함수를 적용하여 선택적 특징 집합을 가능하게 한다.
- SSTL을 통해 서포트 세트와 정렬된 가장 관련 있는 쿼리 패치를 집계하여, 임무 특화 프로토타입을 구성한다.
- 각 쿼리 패치와 정렬된 서포트 프로토타입 내 최근접 이웃 간의 유사도 점수를 계산하는 패치 매칭 모듈(PMM)을 구현하며, 최종 분류를 위해 점수를 누적한다.
- 파arametric 유사도 메트릭에 의존하지 않고, 쿼리 및 서포트 이미지 간의 패치를 비모수적 방식으로 매칭한다.
실험 결과
연구 질문
- RQ1소수 샘플 학습에서 트랜스포머 기반 메커니즘이 쿼리 및 서포트 이미지 간에 임무에 관련된 이미지 패치를 효과적으로 식별할 수 있는가?
- RQ2각 클래스별 처리와 비교해, 쿼리와 전체 서포트 세트 간의 공간 대응을 모델링하면 특징의 구분 능력이 향상되는가?
- RQ3패치 수준의 유사도 계산이 전역 또는 픽셀 수준의 메트릭보다 소수 샘플 인식에서 슈퍼어리어어지는가?
- RQ4기존 어텐션 기반 모델과 비교해, 분포 이탈 및 악성 공격 상황에서 제안된 방법의 성능은 어떠한가?
- RQ5공간 어텐션을 갖춘 밀집된 국소 표현은 전역 특징나 딥 디스크립터보다 더 나은 일반화 성능을 달성할 수 있는가?
주요 결과
- SSFormers는 mini-ImageNet에서 기존 방법들인 CANs, FEAT, RENet을 능가하는 최신 기술 수준의 성능을 달성한다.
- 모델은 다양한 데이터 손상 상황에서도 높은 강인성을 유지하며, 가우시안 블러 조건에서 정확도가 6.7%만 감소하는 반면, Rethink-D는 40.0% 감소한다.
- 패치 매칭 모듈은 직접적인 코사인 유사도보다 뛰어난 분류 정확도를 제공하여, 패치 수준 매칭에서의 효과성을 입증한다.
- t-SNE 시각화 결과, SSFormers는 새로운 클래스에 대해서도 Prototypical Net보다 더 구분 능력 있고 잘 분리된 특징 임베딩을 생성함을 확인한다.
- 정성적 결과에서는 스파스 스페이셜 트랜스포머가 쿼리 및 서포트 이미지에서 모두 관련 있는 영역을 성공적으로 강조하고 배경이나 관련 없는 특징을 억제함을 보여준다.
- 추가적인 패치 처리에도 불구하고 효율적인 스파스 어텐션 덕분에, 인퍼런스 속도가 CANs와 유사한 낮은 시간 복잡도를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.