Skip to main content
QUICK REVIEW

[논문 리뷰] GPViT: A High Resolution Non-Hierarchical Vision Transformer with Group Propagation

Chenhongyi Yang, Jiarui Xu|arXiv (Cornell University)|2022. 12. 13.
Domain Adaptation and Few-Shot Learning인용 수 7
한 줄 요약

GPViT는 고해상도 특징을 유지하고, 학습 가능한 그룹 토큰과 MLPMixer 기반 전파를 통해 효율적인 전역 정보 교환을 가능하게 하는 새로운 그룹 전파 블록(GP 블록)을 갖춘 비계층적 비전 트랜스포머를 제안한다. 이는 파라미터 수가 50% 감소한 상태에서도 ADE20K 세그멘테이션에서 스위니 트랜스포머-B를 능가하며, mIoU 2.0 향상률을 기록한다.

ABSTRACT

We present the Group Propagation Vision Transformer (GPViT): a novel nonhierarchical (i.e. non-pyramidal) transformer model designed for general visual recognition with high-resolution features. High-resolution features (or tokens) are a natural fit for tasks that involve perceiving fine-grained details such as detection and segmentation, but exchanging global information between these features is expensive in memory and computation because of the way self-attention scales. We provide a highly efficient alternative Group Propagation Block (GP Block) to exchange global information. In each GP Block, features are first grouped together by a fixed number of learnable group tokens; we then perform Group Propagation where global information is exchanged between the grouped features; finally, global information in the updated grouped features is returned back to the image features through a transformer decoder. We evaluate GPViT on a variety of visual recognition tasks including image classification, semantic segmentation, object detection, and instance segmentation. Our method achieves significant performance gains over previous works across all tasks, especially on tasks that require highresolution outputs, for example, our GPViT-L3 outperforms Swin Transformer-B by 2.0 mIoU on ADE20K semantic segmentation with only half as many parameters. Project page: chenhongyiyang.com/projects/GPViT/GPViT

연구 동기 및 목표

  • 세분화된 시각 작업을 위해 네트워크 전반에 걸쳐 고해상도 특징을 유지하는 비계층적 비전 트랜스포머를 설계하는 것.
  • 고해상도 환경에서 자기주의의 제곱형 계산 비용 문제를 해결하기 위해 효율적인 전역 정보 교환을 가능하게 하는 것.
  • 밀도 예측 작업에서 성능을 유지하거나 향상시키면서도 비전 트랜스포머의 계층적(피라미드형) 설계가 필요 없도록 하는 것.
  • 고해상도 특징과 효율적인 전역 통신의 조합이 정확도와 효율성 면에서 계층 모델을 능가할 수 있음을 보여주는 것.

제안 방법

  • 고해상도 비전 트랜스포머에서 표준 자기주의를 대체하기 위해 핵심 구성요소로 그룹 전파 블록(GP 블록)을 도입한다.
  • 학습 가능한 그룹 토큰을 사용해 고해상도 이미지 특징을 고정된 수의 그룹으로 군집화함으로써 전역 통신 비용을 감소시킨다.
  • MLPMixer 모듈을 적용해 그룹화된 특징 간 전역 정보를 전파함으로써 저비용의 전역 모델링을 가능하게 한다.
  • 교차주의를 활용해 그룹화된 특징에서 업데이트된 전역 정보를 개별 이미지 토큰으로 다시 전달한다.
  • 이미지 토큰 수에 대해 선형 복잡도를 유지하여 표준 자기주의의 제곱형 스케일링을 피한다.
  • 모든 스테이지에 걸쳐 GP 블록을 사용해 단순한 비계층 아키텍처를 구성함으로써 특징의 다운샘플링과 스케일 조합을 회피한다.

실험 결과

연구 질문

  • RQ1전체 해상도 특징을 유지하는 비계층적 비전 트랜스포머가 세그멘테이션 및 검출과 같은 밀도 예측 작업에서 계층 모델을 능가할 수 있는가?
  • RQ2제곱형 계산 비용을 유발하지 않으면서도 고해상도 비전 트랜스포머에서 효율적인 전역 정보 교환을 달성할 수 있는가?
  • RQ3기존의 전역 통신 메커니즘(예: 전역 자기주의, 컨볼루션, 윈도우 자기주의)과 비교해 GP 블록은 정확도와 효율성 면에서 어떻게 성능을 내는가?
  • RQ4성능과 계산 비용의 균형을 고려할 때 최적의 그룹 토큰 수와 구성은 무엇인가?
  • RQ5국소 자기주의와 GP 블록의 조합이 고해상도 환경에서 국소 자기주의만을 사용할 경우보다 더 높은 성능을 낼 수 있는가?

주요 결과

  • GPViT-L3는 파라미터 수가 절반인 상태에서도 ADE20K 세그멘테이션에서 스위니 트랜스포머-B를 2.0 mIoU 높이기 성과를 기록한다.
  • GPViT-L1은 COCO 인스턴스 세그멘테이션에서 파라미터 수가 30% 감소한 상태에서도 2.6 APbb와 1.4 mk 높은 성능을 기록한다.
  • GPViT-L2는 ADE20K 세그멘테이션에서 스위니 트랜스포머-B를 0.5 mIoU 높이며 파라미터 수가 40% 감소한 상태에서 성능을 냈다.
  • GP 블록은 전역 자기주의, 윈도우 자기주의 등 테스트된 모든 전역 통신 방법 중에서 ImageNet(80.5%)과 ADE20K(46.9 mIoU)에서 가장 높은 정확도를 기록했다.
  • 블록당 64개의 그룹 토큰을 사용하고 스테이지 간에 점차 16개로 감소시키는 것이 정확도와 FLOPs 사이의 최적의 균형을 이룬다.
  • GP 블록은 ImageNet에서 FLOP 수가 5.8G, ADE20K에서 34G로 기준 국소 자기주의 모델과 동일한 수준을 유지하면서도 정확도를 크게 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.