Skip to main content
QUICK REVIEW

[논문 리뷰] PyramidTNT: Improved Transformer-in-Transformer Baselines with Pyramid Architecture

Kai Han, Jianyuan Guo|arXiv (Cornell University)|2022. 01. 04.
Advanced Memory and Neural ComputingEngineering인용 수 18
한 줄 요약

PyramidTNT은 계층적 피라미드 아키텍처와 컨볼루션 스템을 도입하여 Transformer-in-Transformer (TNT) 기반 모델의 성능을 향상시켰으며, 이미지 분류 및 객체 검출에서 최신 기준 성능을 달성하였다. 단지 3.3B FLOPs로 ImageNet-1K에서 82.0%의 top-1 정확도를 기록하여 Swin-T와 원본 TNT를 모두 능가하면서도 계산 비용은 낮게 유지하였다.

ABSTRACT

Transformer networks have achieved great progress for computer vision tasks. Transformer-in-Transformer (TNT) architecture utilizes inner transformer and outer transformer to extract both local and global representations. In this work, we present new TNT baselines by introducing two advanced designs: 1) pyramid architecture, and 2) convolutional stem. The new "PyramidTNT" significantly improves the original TNT by establishing hierarchical representations. PyramidTNT achieves better performances than the previous state-of-the-art vision transformers such as Swin Transformer. We hope this new baseline will be helpful to the further research and application of vision transformer. Code will be available at https://github.com/huawei-noah/CV-Backbones/tree/master/tnt_pytorch.

연구 동기 및 목표

  • 계층적 특징 학습을 통해 비전 작업에 대한 Transformer-in-Transformer (TNT) 아키텍처의 성능을 향상시키는 것.
  • 표준 패치 파티셔닝 스템 대신 컨볼루션 스템을 도입하여 학습 안정성과 표현 학습을 향상시키는 것.
  • Swin Transformer와 원본 TNT와 같은 기존 모델들을 능가하는 더 강력한 새로운 기준을 설정하는 것.
  • 단계별로 점차 감소하는 공간 해상도를 가지는 피라미드 구조를 통해 효율적인 다중 척도 특징 추출을 가능하게 하는 것.

제안 방법

  • 네 개의 스테이지로 구성된 피라미드 아키텍처를 도입하여 각 스테이지에서 공간 해상도를 2배로 감소시켜 계층적 특징 학습을 가능하게 한다.
  • 다섯 개의 3x3 컨볼루션을 포함한 컨볼루션 스템을 활용하여 패치 임베딩 향상과 학습 안정성 향상을 도모한다.
  • 스테이지 간의 다운샘플링을 위해 패치 머징 레이어를 사용하여 특징 계층을 유지하면서 시퀀스 길이를 감소시킨다.
  • 외부 트랜스포머는 전반적인 표현을 처리하고 내부 트랜스포머는 국소 패치 간 관계를 모델링하는 이중 브랜치 트랜스포머 설계를 적용한다.
  • 학습 가능한 감소 비율을 가진 학습 가능한 공간 감소 어텐션(LSRA)을 통합하여 국소 토큰을 압축한다.
  • 강건성을 확보하기 위해 가중치 감소, AdamW 옵timizer, 다중 척도 데이터 증강과 같은 표준 학습 기법을 사용한다.

실험 결과

연구 질문

  • RQ1피라미드 아키텍처는 비전 작업에서 TNT 모델의 표현 능력을 향상시킬 수 있는가?
  • RQ2표준 패치 파티셔닝 스템을 컨볼루션 스템으로 대체하면 학습 안정성과 성능이 향상되는가?
  • RQ3PyramidTNT는 FLOPs를 줄이며 기존 최고 성능의 비전 트랜스포머인 Swin Transformer를 능가할 수 있는가?
  • RQ4PyramidTNT의 계층적 특징 학습 방식은 COCO에서의 객체 검출 성능에 어떤 영향을 미치는가?

주요 결과

  • PyramidTNT-S는 단지 3.3B FLOPs로 ImageNet-1K에서 82.0%의 top-1 정확도를 달성하여 원본 TNT-S와 Swin-T를 모두 능가하였다.
  • COCO 객체 검출에서 PyramidTNT-S는 1x 스케줄 하에 RetinaNet을 사용해 42.0 mAP를 기록하였으며, Swin-T를 0.5 mAP 뛰어넘었다.
  • 다중 척도 학습과 3x 스케줄을 적용한 결과, PyramidTNT-S는 Mask R-CNN에서 51.0 mAP를 기록하여 Hire-MLP-S를 0.9 mAP 뛰어넘었고, FLOPs도 더 적게 사용하였다.
  • 모델은 Ti, S, M, B 등 모든 백본 크기에서 뛰어난 성능를 유지하였으며, FLOPs 범위는 0.6B에서 16.0B까지 다양했다.
  • 피라미드 구조와 컨볼루션 스템의 조합은 특히 객체 검출 작업에서 큰 객체에 대해 더 나은 특징 표현을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.