Skip to main content
QUICK REVIEW

[논문 리뷰] P2T: Pyramid Pooling Transformer for Scene Understanding

Yu-Huan Wu, Yun Liu|arXiv (Cornell University)|2021. 06. 22.
Advanced Neural Network Applications참고 문헌 71인용 수 11
한 줄 요약

이 논문은 다중 헤드 자기주의(MHSA)에서 단일 풀링 연산을 피라미드 풀링으로 대체하여 시퀀스 길이를 동시에 줄이고 문맥 표현을 향상시키는 비전 트랜스포머 기반 모델인 피라미드 풀링 트랜스포머(P2T)를 제안한다. P2T는 이미지 분류, 세분화, 객체 검출, 인스턴스 세분화 등 다양한 작업에서 최신 기술 수준(SOTA) 성능을 달성하며, ImageNet-1K 및 ADE20K 벤치마크에서 이전의 CNN 및 트랜스포머 기반 모델들을 능가한다.

ABSTRACT

Recently, the vision transformer has achieved great success by pushing the state-of-the-art of various vision tasks. One of the most challenging problems in the vision transformer is that the large sequence length of image tokens leads to high computational cost (quadratic complexity). A popular solution to this problem is to use a single pooling operation to reduce the sequence length. This paper considers how to improve existing vision transformers, where the pooled feature extracted by a single pooling operation seems less powerful. To this end, we note that pyramid pooling has been demonstrated to be effective in various vision tasks owing to its powerful ability in context abstraction. However, pyramid pooling has not been explored in backbone network design. To bridge this gap, we propose to adapt pyramid pooling to Multi-Head Self-Attention (MHSA) in the vision transformer, simultaneously reducing the sequence length and capturing powerful contextual features. Plugged with our pooling-based MHSA, we build a universal vision transformer backbone, dubbed Pyramid Pooling Transformer (P2T). Extensive experiments demonstrate that, when applied P2T as the backbone network, it shows substantial superiority in various vision tasks such as image classification, semantic segmentation, object detection, and instance segmentation, compared to previous CNN- and transformer-based networks. The code will be released at https://github.com/yuhuan-wu/P2T.

연구 동기 및 목표

  • 패치 토큰으로 인한 긴 시퀀스 길이로 인한 비전 트랜스포머의 높은 계산 비용을 해결하기 위해.
  • 단일 풀링 연산을 초월하여 풀링된 특징의 표현 능력을 향상시키기 위해.
  • 더 나은 문맥 추상화를 위해 피라미드 풀링을 다중 헤드 자기주의(MHSA)에 통합하면서도 시퀀스 길이를 줄이기 위해.
  • 다양한 장면 이해 작업에 적합한 통합적이고 효율적이며 강력한 비전 트랜스포머 기반 모델을 설계하기 위해.
  • MHSA에 피라미드 풀링을 적용할 경우 다양한 비전 벤치마크에서 일관된 성능 향상이 이루어지는지 입증하기 위해.

제안 방법

  • 표준 단일 풀링을 피라미드 풀링으로 대체하여, 다양한 커널 크기와 스트라이드를 가진 다중 평균 풀링 연산을 입력 특징 맵에 적용한다.
  • 각 스테이지에서 다중 해상도(예: {1, 2, 3, 6})의 피드포워드 특징을 생성하기 위해 적응형 평균 풀링을 사용하여 공간적 문맥을 유지한다.
  • 풀링된 특징을 연결하거나 원소별 조합을 통해 MHSA에 통합하여 다중 수용장역도 표현을 가진 전역 주의를 가능하게 한다.
  • 특히 저해상도에서 효과적인 공간적 관계 모델링을 위해 풀링된 특징에 상대적 위치 인코딩(RPE)을 도입한다.
  • 지역 유도 편향을 향상시키고 특징 학습을 개선하기 위해 피드포워드 네트워크(IRB)에 깊이 분리형 컨볼루션을 통합한다.
  • 초기 스테이지에서 공간 연속성을 유지하고 특징 표현을 향상시키기 위해 겹치는 패치 임베딩을 채택한다.

실험 결과

연구 질문

  • RQ1MHSA에 피라미드 풀링을 적용할 경우 시퀀스 길이를 줄이면서도 비전 트랜스포머의 특징 표현 능력을 향상시킬 수 있는가?
  • RQ2비전 트랜스포머 기반 모델에서 피라미드 풀링과 단일 풀링 간의 성능 및 효율성은 어떻게 비교되는가?
  • RQ3MHSA에 피라미드 풀링을 통합할 경우 분류, 세분화, 검출과 같은 다양한 비전 작업에서 일관된 성능 향상이 이루어지는가?
  • RQ4풀링 유형, 풀링 비율, 활성화 함수, 위치 인코딩과 같은 설계 선택 사항 중 성능에 가장 큰 영향을 미치는 요소는 무엇인가?
  • RQ5피라미드 풀링을 통합한 통합형 트랜스포머 기반 모델이 다양한 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • P2T는 ImageNet-1K에서 상위-1 정확도 79.7%와 ADE20K 세분화에서 44.1%의 mIoU를 기록하며, ResNet, Swin Transformer, PVT를 능가한다.
  • 최대 풀링 또는 깊이 분리형 컨볼루션 대비 평균 풀링을 사용할 경우 mIoU가 최대 2.8% 향상되어 특징 추상화에서의 우수성을 입증한다.
  • 비율을 고정하는 대신 크기를 고정할 경우 GFLOPs가 12% 감소하고 메모리가 10% 감소하지만, 상위-1 정확도는 0.3% 감소하고 mIoU는 2.4% 감소하므로 비율 고정이 바람직하다.
  • 기본 모델에 상대적 위치 인코딩(RPE)을 추가하면 상위-1 정확도가 1.7% 향상되고 mIoU도 1.7% 향상되어 저해상도 풀링 특징에서의 가치를 입증한다.
  • IRB(피드포워드 네트워크 내 깊이 분리형 컨볼루션)를 추가하면 mIoU가 5.4% 향상되고 상위-1 정확도가 3.2% 향상되어 2D 국소성의 특징 학습에 유리함을 보여준다.
  • 겹치는 패치 임베딩은 상위-1 정확도를 0.2% 향상시키고 mIoU를 1.4% 향상시켜 특징 표현에 긍정적인 영향을 미친다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.