Skip to main content
QUICK REVIEW

[논문 리뷰] Tree Structure-Aware Few-Shot Image Classification via Hierarchical Aggregation

Min Zhang, Siteng Huang|arXiv (Cornell University)|2022. 07. 14.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 사전 학습 태스크에서 생성된 증강 이미지 간의 관계를 트리 구조로 모델링하고 게이팅 어그리게이터를 통해 유용한 특징을 적응적으로 선택함으로써 소수의 이미지 분류에 효과적인 플러그인형 계층적 트리 구조 인식(HTS) 방법을 제안한다. HTS는 구조적 특징 통합을 통해 사전 학습 태스크를 더 효과적으로 활용함으로써 네 가지 벤치마크 데이터셋에서 여러 소수의 학습 방법을 크게 향상시키며, 새로운 최고 성능(SOTA)을 달성한다.

ABSTRACT

In this paper, we mainly focus on the problem of how to learn additional feature representations for few-shot image classification through pretext tasks (e.g., rotation or color permutation and so on). This additional knowledge generated by pretext tasks can further improve the performance of few-shot learning (FSL) as it differs from human-annotated supervision (i.e., class labels of FSL tasks). To solve this problem, we present a plug-in Hierarchical Tree Structure-aware (HTS) method, which not only learns the relationship of FSL and pretext tasks, but more importantly, can adaptively select and aggregate feature representations generated by pretext tasks to maximize the performance of FSL tasks. A hierarchical tree constructing component and a gated selection aggregating component is introduced to construct the tree structure and find richer transferable knowledge that can rapidly adapt to novel classes with a few labeled images. Extensive experiments show that our HTS can significantly enhance multiple few-shot methods to achieve new state-of-the-art performance on four benchmark datasets. The code is available at: https://github.com/remiMZ/HTS-ECCV22.

연구 동기 및 목표

  • 기존의 소수의 학습 방법이 사전 학습 태스크에서 생성된 모든 증강 이미지를 무분별하게 사용하는 데서 비롯되는 한계를 해결하기 위해, 의미가 모호한 정보를 포함할 수 있는 증강 이미지의 사용이 성능 저하를 초래할 수 있음을 고려한다.
  • 사람이 레이블링한 정보를 초월해 사전 학습 태스크에서 이전 가능한 지식을 학습함으로써 소수의 학습에서 일반화 능력을 향상시키기 위해 노력한다.
  • 다양한 사전 학습 태스크에서 유사도에 따라 관련성이 높은 특징 표현을 적응적으로 선택하고 통합할 수 있는 유연하고 플러그인 방식의 프레임워크를 개발한다.
  • 원본 이미지와 그 증강 이미지 간의 계층적 관계를 트리 구조로 모델링함으로써 사전 학습 태스크나 증강 데이터에 동적인 변화를 수용할 수 있다.

제안 방법

  • 원본 이미지와 다양한 사전 학습 태스크에서 유도된 증강 이미지 간의 관계를 모델링하기 위해 계층적 트리 구조를 도입하며, 노드는 이미지를 나타내고 간선은 특징 유사도를 코딩한다.
  • 트리의 다중 레벨은 다양한 사전 학습 태스크에서 유도된 특징을 표현하여, 모델이 작업별 특성과 공통 특성을 계층적으로 학습할 수 있도록 한다.
  • TreeLSTM 기반의 게이팅 선택 통합 구성 요소를 사용하여 트리 내의 다양한 노드에서 유도된 특징을 동적으로 가중 평균하고 통합함으로써 정보성과 이식 가능성이 높은 표현을 우선순위로 한다.
  • 이 방법은 데이터 증강(DA) 및 자기지도 학습(SSL) 설정 모두에서 작동하여 기존의 소수의 학습 프레임워크에 플러그인 방식으로 통합될 수 있다.
  • 모델은 소수의 분류 손실와 사전 학습 태스크 손실을 동시에 최적화하는 다중 목적 최적화를 통해 훈련되며, 트리 구조가 특징 융합을 선택적으로 이끄는 데 기여한다.
  • 표준 백본(예: Conv4 및 ResNet12)과 호환되며, 전역 평균 풀링과 최종 완전 연결 계층을 통해 64차원 임베딩을 엔드 투 엔드 방식으로 적용한다.

실험 결과

연구 질문

  • RQ1증강 이미지의 구조적 표현이 표준 데이터 증강 또는 자기지도 학습을 넘어서 소수의 학습 분류 성능 향상에 기여할 수 있는가?
  • RQ2다양한 사전 학습 태스크에서 유용한 특징 표현을 적응적으로 선택하여 의미가 모호한 증강 이미지로 인한 악영향(부정적 전이)을 방지할 수 있는가?
  • RQ3증강 이미지 간의 계층적 관계를 모델링함으로써 저샷 설정에서 특징의 이식 가능성과 일반화 능력이 얼마나 향상되는가?
  • RQ4제안된 방법이 다양한 데이터셋과 소수의 학습 설정, 특히 교차 도메인 시나리오에서도 일반화 가능한가?

주요 결과

  • HTS는 1-shot 및 5-shot 설정 모두에서 네 가지 벤치마크 데이터셋(미니-이미지넷, 티어드-이미지넷, CUB-200-2011, CIFAR-FS)에서 새로운 최고 성능(SOTA)을 달성한다.
  • 미니-이미지넷에서, 회전 및 색상 순열 사전 학습 태스크를 사용할 경우, HTS는 5-way 1-shot 설정에서 ProtoNet의 정확도를 2.1% 향상시키고, 5-way 5-shot 설정에서는 1.8% 향상시킨다.
  • 메서드는 강력한 교차 도메인 일반화 능력을 보이며, 교차 도메인 평가에서 단일 도메인 및 비대각선 도메인 이동 설정 전반에서 ProtoNet을 초월한다.
  • Grad-CAM 시각화 결과, HTS는 기준 모델 대비 사전 학습 태스크로 인한 의미적 편향을 줄이고, 분류에 기여하는 분명한 국소적 객체 특징에 주의를 집중하도록 유도한다.
  • 절단 실험 결과, 계층적 트리 구조와 게이팅 통합 메커니즘이 모두 필수적임을 확인하였으며, 트리 구조는 더 나은 특징 정렬을 가능하게 하고 게이팅 메커니즘은 선택 정확도를 향상시킨다.
  • 다양한 사전 학습 태스크(예: 회전 및 색상 순열)에 대해 강건한 성능을 보이며, 모든 네 가지 데이터셋에서 태스크 유형에 관계없이 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.