[논문 리뷰] Group Generalized Mean Pooling for Vision Transformer
이 논문은 시각 Transformer(ViT)를 위한 그룹 일반화 평균(GGeM) 풀링을 제안한다. GGeM 풀링은 채널 특징을 그룹으로 나누고, 각 그룹에 대해 학습 가능한 GeM 풀링을 적용하여 채널별 중요도를 더 잘 포착한다. GGeM은 ImageNet-1K에서 ViT의 성능을 top-1 정확도 기준 0.1–0.7% 향상시키며, ViT-Base 및 ViT-Large에서 최신 기준 성능을 달성한다. 또한 이미지 검색 및 다중 모odal 학습 과제에서 베이스라인을 능가한다.
Vision Transformer (ViT) extracts the final representation from either class token or an average of all patch tokens, following the architecture of Transformer in Natural Language Processing (NLP) or Convolutional Neural Networks (CNNs) in computer vision. However, studies for the best way of aggregating the patch tokens are still limited to average pooling, while widely-used pooling strategies, such as max and GeM pooling, can be considered. Despite their effectiveness, the existing pooling strategies do not consider the architecture of ViT and the channel-wise difference in the activation maps, aggregating the crucial and trivial channels with the same importance. In this paper, we present Group Generalized Mean (GGeM) pooling as a simple yet powerful pooling strategy for ViT. GGeM divides the channels into groups and computes GeM pooling with a shared pooling parameter per group. As ViT groups the channels via a multi-head attention mechanism, grouping the channels by GGeM leads to lower head-wise dependence while amplifying important channels on the activation maps. Exploiting GGeM shows 0.1%p to 0.7%p performance boosts compared to the baselines and achieves state-of-the-art performance for ViT-Base and ViT-Large models in ImageNet-1K classification task. Moreover, GGeM outperforms the existing pooling strategies on image retrieval and multi-modal representation learning tasks, demonstrating the superiority of GGeM for a variety of tasks. GGeM is a simple algorithm in that only a few lines of code are necessary for implementation.
연구 동기 및 목표
- 기존의 풀링 전략이 채널 간 활성화 패tern에 관계없이 모든 채널을 동일하게 취급하는 한계를 해결한다.
- 표준 평균, 최대값, 또는 GeM 풀링에서 고려되지 않는 ViT 활성화 맵의 채널별 차이를 활용하여 특징 표현을 향상시킨다.
- 헤드 간 의존성을 줄이고 글로벌 특징 학습을 향상시키기 위해 ViT의 멀티헤드 어텐션 아키텍처와 호환되는 단순하면서도 효과적인 풀링 기법을 설계한다.
- 이국적 시각 과제, 즉 이미지 분류, 이미지 검색, 다중 모달 표현 학습 등 다양한 과제에서 GGeM 풀링의 유효성을 입증한다.
- 최소한의 아키텍처 수정으로 ViT-Base 및 ViT-Large가 ImageNet-1K에서 새로운 최고 성능을 확립한다.
제안 방법
- ViT 인코더의 어텐션 헤드 수에 따라 최종 특징 맵의 채널을 여러 그룹으로 나눈다.
- 각 그룹 내에서 공유된 학습 가능한 풀링 파라미터를 사용해 일반화 평균(GeM) 풀링을 독립적으로 적용한다.
- GGeM 연산을 다음과 같이 수식으로 표현한다: $ y_g = \left( \frac{1}{N_g} \sum_{i \in G_g} x_i^p \right)^{1/p} $, 여기서 $ G_g $는 g번째 채널 그룹이며 $ p $는 그룹별로 학습 가능한 파라미터이다.
- GGeM을 ViT의 최종 레이어에서 클래스 토큰 또는 평균 풀링의 대체로 통합하여 엔드 투 엔드 학습을 가능하게 한다.
- 각 그룹 내에서 공간적 위치 간 동일한 풀링 파라미터를 사용하여 공간적 구조를 유지하면서 중요한 채널에 초점을 맞춘다.
- ImageNet-1K, CUB200, Cars196, SOP, 그리고 Flickr30k 및 MSCOCO와 같은 다중 모달 벤치마크에서 ViT 모델을 GGeM 풀링으로 학습 및 미세조정한다.
실험 결과
연구 질문
- RQ1풀링 전략이 시각 Transformer의 기울기 집중도와 어텐션 헤드 특화도에 미치는 영향은 무엇인가?
- RQ2풀링 연산에서 채널을 그룹화하면 헤드 간 유사도를 줄이고 ViT의 특징 다양성을 향상시킬 수 있는가?
- RQ3각 채널 그룹에 별도의 풀링 파라미터를 학습하는 것이 모든 채널에 공유된 풀링보다 성능을 향상시키는가?
- RQ4정확도 및 일반화 능력 측면에서 GGeM 풀링이 평균, 최대값, GeM 풀링보다 어떻게 비교되는가? 이는 이미지 분류, 검색, 다중 모달 과제에서 모두 해당된다.
- RQ5GGeM 풀링은 시각 모델의 사전학습 및 미세조정 설정 모두에 효과적으로 적용될 수 있는가?
주요 결과
- GGeM 풀링은 ViT-Base 및 ViT-Large에서 ImageNet-1K에서 각각 71.5%의 새로운 최고 성능 top-1 정확도를 달성하여, 기존 베이스라인 풀링 방법보다 0.1–0.7%p 향상되었다.
- CUB200 데이터셋에서 GGeM은 R@1 75.2%, RP 45.0%, mAP 34.6%를 기록하여 GeM(75.0%, 44.1%, 34.1%) 및 최대값 풀링(74.6%, 43.6%, 33.1%)을 초월했다.
- 다중 모달 제로샷 검색에서 GGeM은 Flickr30k에서 R@1 11.5% 및 R@5 27.7%를 달성하여 GeM(10.7%, 26.9%) 및 최대값 풀링(9.9%, 25.7%)을 능가했다.
- 14개의 벤치마크에서 평균적으로 GGeM은 클래스 토큰 기반 베이스라인 대비 1.0% 향상된 제로샷 이미지 분류 정확도를 보였다.
- 분석 결과, GGeM은 헤드 간 유사도를 감소시키며, 풀링 파라미터 $ p $ 가 증가할수록 글로벌 정보에 집중하는 헤드의 수가 증가하는 것으로 나타났다.
- 이 방법은 몇 줄의 코드로 간편하게 구현 가능하여, 기존 ViT 프레임워크에 쉽게 통합할 수 있는 높은 실용성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.