Skip to main content
QUICK REVIEW

[논문 리뷰] BatchFormerV2: Exploring Sample Relationships for Dense Representation Learning

Zhi Hou, Baosheng Yu|arXiv (Cornell University)|2022. 04. 04.
Advanced Neural Network Applications인용 수 10
한 줄 요약

BatchFormerV2는 시각 Transformer에서 조밀한 표현 학습을 위해 미니배치 내 샘플 간 관계를 모델링하는 플러그 앤 플레이 형식의 배치 Transformer 모듈을 도입한다. 이중 스트림 학습 전략을 사용함으로써 추론 비용 없이도 훈련 중에 패치 및 이미지 간의 정보 흐름을 가능하게 하여, DETR 기반 모델에서 이미지 분류, 객체 검출, 페노틱 세그멘테이션 작업에서 최대 1.3% 향상시키며 일관되게 성능 향상을 이룬다.

ABSTRACT

Attention mechanisms have been very popular in deep neural networks, where the Transformer architecture has achieved great success in not only natural language processing but also visual recognition applications. Recently, a new Transformer module, applying on batch dimension rather than spatial/channel dimension, i.e., BatchFormer [18], has been introduced to explore sample relationships for overcoming data scarcity challenges. However, it only works with image-level representations for classification. In this paper, we devise a more general batch Transformer module, BatchFormerV2, which further enables exploring sample relationships for dense representation learning. Specifically, when applying the proposed module, it employs a two-stream pipeline during training, i.e., either with or without a BatchFormerV2 module, where the batchformer stream can be removed for testing. Therefore, the proposed method is a plug-and-play module and can be easily integrated into different vision Transformers without any extra inference cost. Without bells and whistles, we show the effectiveness of the proposed method for a variety of popular visual recognition tasks, including image classification and two important dense prediction tasks: object detection and panoptic segmentation. Particularly, BatchFormerV2 consistently improves current DETR-based detection methods (e.g., DETR, Deformable-DETR, Conditional DETR, and SMCA) by over 1.3%. Code will be made publicly available.

연구 동기 및 목표

  • 현재의 시각 Transformer가 훈련 중에 상호 샘플 관계를 활용하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 이미지 수준을 초월해 픽셀/패치 수준의 표현으로까지 배치 어텐션을 확장함으로써 강력한 조밀한 표현 학습을 가능하게 하기 위해.
  • 파rametric 배치 어텐션 모듈을 적용할 때 발생하는 훈련-테스트 불일치 문제를 해결하기 위해.
  • 추론 비용을 추가하지 않고 성능 향상을 이룰 수 있는 플러그 앤 플레이 모듈을 개발하기 위해.
  • 이중 분류, 검출, 세그멘테이션을 포함한 다양한 시각 작업에서의 효과성을 입증하기 위해.

제안 방법

  • 미니배치 내 샘플 간 관계를 모델링하기 위해 배치 차원을 따라 자기 어텐션을 적용하는 일반적인 배치 Transformer 모듈인 BatchFormerV2를 제안한다.
  • 두 개의 스트림을 갖춘 이중 스트림 학습 파이프라인을 사용한다: 하나의 스트림에는 BatchFormerV2 모듈이 포함되어 있고, 다른 하나는 포함되어 있지 않으며, 양쪽 스트림 간에 공유된 레이어/블록을 사용한다.
  • 배치 불변 표현 학습을 보장하기 위해 BatchFormerV2 모듈 앞뒤로 공유된 분류기 헤드를 사용한다.
  • 훈련 중에 이미지 간뿐 아니라 서로 다른 샘플 내 패치 및 픽처 간의 정보 전파를 가능하게 한다.
  • 추론 시에 BatchFormerV2 모듈을 제거할 수 있도록 하여 추가적인 계산 비용 없이도 구현 가능하다.
  • 시각 Transformer 아키텍처의 다양한 블록에 모듈을 적용하여 다중 수준의 표현 학습을 지원한다.

실험 결과

연구 질문

  • RQ1미니배치 내 상호 샘플 관계를 모델링하면 시각 Transformer에서 조밀한 표현 학습이 향상되는가?
  • RQ2배치 어텐션을 이미지 수준이 아닌 픽셀/패치 수준에 효과적으로 적용할 수 있는가?
  • RQ3추론 오버헤드 없이 플러그 앤 플레이 형식의 배치 Transformer 모듈을 훈련시킬 수 있는가?
  • RQ4제안된 방법이 분류, 검출, 세그멘테이션을 포함한 다양한 시각 작업에서 성능 향상을 이끌 수 있는가?
  • RQ5자료가 부족하거나 소규모 데이터셋 환경에서 이 방법의 성능은 어떠한가?

주요 결과

  • 초기 학습 시, BatchFormerV2는 CIFAR-100에서 DeiT-Ti의 성능을 49.2%에서 58.7%로 9.5% 향상시키고, DeiT-B는 52.2%에서 66.6%로 14.4% 향상시켰다.
  • ImageNet에서는 BatchFormerV2가 DeiT-Ti를 72.2%에서 72.7%로 0.5% 향상시키고, DeiT-S는 79.8%에서 80.4%로 0.6% 향상시키며, DeiT-B는 81.7%에서 82.2%로 0.5% 향상시켰다.
  • 객체 검출 작업에서는 BatchFormerV2가 테스트된 모든 DETR 기반 모델에서 AP 기준 1.3% 이상 향상시켰다.
  • 페노틱 세그멘테이션 작업에서는 다양한 백본 아키텍처에서 일관된 성능 향상을 달성했다.
  • 강력한 데이터 증강이 ImageNet에서 성능 향상을 제한할 수 있는 상황에서, CIFAR-100과 같은 소규모 데이터셋에서 특히 유리한 성능 향상을 보였다.
  • 이중 스트림 학습 전략은 훈련-테스트 불일치 문제를 성공적으로 방지하였으며, 추론 비용 없이도 플러그 앤 플레이 배포가 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.