[논문 리뷰] BatchFormer: Learning to Explore Sample Relationships for Robust Representation Learning
BatchFormer는 훈련 중 샘플 간 관계를 학습하기 위해 배치 차원에서 작동하는 플러그 앤 플레이 트랜스포머 모듈을 도입하여, 저샷 및 尾클래스 인식에 특히 유리한 교차 샘플 지식 전이를 가능하게 한다. 모듈 전후로 분류기를 공유함으로써 추론 오버헤드를 제거하고, 추가 구성 요소 없이도 장꼬리 인식, 제로샷 학습, 도메인 일반화, 대비 학습 등에서 최신 기준 성능을 달성한다.
Despite the success of deep neural networks, there are still many challenges in deep representation learning due to the data scarcity issues such as data imbalance, unseen distribution, and domain shift. To address the above-mentioned issues, a variety of methods have been devised to explore the sample relationships in a vanilla way (i.e., from the perspectives of either the input or the loss function), failing to explore the internal structure of deep neural networks for learning with sample relationships. Inspired by this, we propose to enable deep neural networks themselves with the ability to learn the sample relationships from each mini-batch. Specifically, we introduce a batch transformer module or BatchFormer, which is then applied into the batch dimension of each mini-batch to implicitly explore sample relationships during training. By doing this, the proposed method enables the collaboration of different samples, e.g., the head-class samples can also contribute to the learning of the tail classes for long-tailed recognition. Furthermore, to mitigate the gap between training and testing, we share the classifier between with or without the BatchFormer during training, which can thus be removed during testing. We perform extensive experiments on over ten datasets and the proposed method achieves significant improvements on different data scarcity applications without any bells and whistles, including the tasks of long-tailed recognition, compositional zero-shot learning, domain generalization, and contrastive learning. Code will be made publicly available at https://github.com/zhihou7/BatchFormer.
연구 동기 및 목표
- 장꼬리 클래스 분포, 도메인 이동, 그리고 알려지지 않은 클래스와 같은 데이터 부족 문제를 해결하기 위해 깊이 있는 표현 학습에 도전한다.
- 기존 방법들이 입력 또는 손실 함수를 통해만 샘플 간 관계를 탐색하는 데에 그치는 한계를 극복하기 위해, 심층 신경망의 내부 구조를 통해 샘플 간 관계를 탐색할 수 있도록 한다.
- 훈련 중 각 미니배치의 샘플들 간의 관계를 암묵적으로 학습하고 활용할 수 있도록 심층 신경망을 설계한다.
- 모듈을 추론 시 제거할 수 있도록 모듈 전후로 분류기를 공유함으로써 훈련-추론 간 격차를 줄인다.
제안 방법
- 각 미니배치 내 샘플을 시퀀스의 토큰으로 간주하고 표준 트랜스포머 인코더를 적용하여 샘플 간 상호관계를 모델링하는 BatchFormer 모듈을 도입한다.
- 배치 차원에 BatchFormer를 적용하여 각 샘플의 손실에서 다른 모든 샘플로 기울기 흐름이 유도되며, 이는 가상의 데이터 증강을 효과적으로 생성한다.
- 훈련 중 모듈 전후로 동일한 분류기를 사용함으로써 배치 불변 표현 학습을 강화하고 추론 시 모듈 제거를 가능하게 한다.
- 특히 희귀 클래스에 유리하게 특징의 분류 능력과 일반화 능력을 향상시키기 위해 균형 잡힌 소프트맥스와 대비 학습 목적함수를 활용한다.
- Grad-CAM과 기울기 분석을 활용하여 BatchFormer가 관련 객체 부위에 주의를 집중시키고, 부적절한 상관관계를 감소시킴을 시각화한다.
- 배치 크기, 분류기 공유, 백본 아키텍처 등의 설계 선택 사항과 그 탄력성을 검증하기 위해 광범위한 추상화 연구를 수행한다.
실험 결과
연구 질문
- RQ1미니배치 내 샘플 간 관계를 모델링하면 데이터 부족 상황에서 표현 학습이 향상되는가?
- RQ2배치 기반 트랜스포머 모듈은 장꼬리 인식에서 저샷 및 테일 클래스의 특징 학습에 기여하는가?
- RQ3기존 모델에 BatchFormer 모듈을 수정 없이 통합할 수 있는가?
- RQ4공유된 분류기 메커니즘이 배치 기반 표현 학습에서 훈련-추론 격차를 어떻게 완화하는가?
- RQ5BatchFormer는 제로샷 학습, 도메인 일반화, 대비 학습에서 얼마나 강건성을 향상시키는가?
주요 결과
- BatchFormer는 장꼬리 인식, 제로샷 학습, 도메인 일반화, 대비 학습 등 여러 데이터 부족 작업에서 10개 이상의 데이터셋에서 최신 기준 성능을 달성한다.
- ImageNet-LT에서 BatchFormer는 'All' 클래스의 상위-1 정확도 50.9%를 기록하여 공유 분류기를 사용한 베이스라인을 능가하며, 소수 샘플 성능을 크게 향상시켰다.
- BatchFormer를 적용한 모델는 더 빠른 수렴을 보이며, 단 38 에포크 만에 moco-v3 수준의 성능에 도달하여 훈련 효율성이 향상됨을 보여준다.
- 추상화 연구 결과, 배치 크기가 128 이하일 경우 BatchFormer는 배치 크기 변화에 덜 민감하며, 희귀 클래스에서 배치 크기 512가 가장 우수한 성능을 내는 것으로 나타났다.
- Grad-CAM 시각화 결과, BatchFormer가 객체 부위에 주의를 집중시키고 복잡한 환경에서의 배경과의 부적절한 상관관계를 억제함을 확인하였다.
- 기울기 분석 결과, 희귀 클래스가 미니배치 내 다른 이미지에 대해 더 큰 기울기를 유도하는 것으로 나타나, 저샷 학습에 유리한 암묵적 데이터 증강이 이루어지고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.