Skip to main content
QUICK REVIEW

[논문 리뷰] EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm

Jiangning Zhang, Xiangtai Li|arXiv (Cornell University)|2022. 06. 19.
CCD and CMOS Imaging Sensors인용 수 15
한 줄 요약

이 논문은 진화 알고리즘(EA)에 영감을 받은 비전 트랜스포머 아키텍처인 EATFormer을 제안한다. EAT는 다중 스케일 영역 집합(MSRA), 글로벌 및 로컬 상호작용(GLI), 피드포워드 네트워크(FFN) 모듈을 포함한 EA 기반 트랜스포머 블록(EAT)을 도입하여 다중 스케일, 상호작용형, 개별 특징을 모델링한다. 기존의 SOTA 방법들보다 더 적은 FLOPs로 COCO 객체 검출 및 ADE20K 세그멘테이션에서 성능을 뛰어넘으며, ImageNet-1K에서 기준 모델(49.0M 파라미터)로 83.9%의 Top-1 정확도를 달성하여 SOTA 성능을 기록한다.

ABSTRACT

Motivated by biological evolution, this paper explains the rationality of Vision Transformer by analogy with the proven practical evolutionary algorithm (EA) and derives that both have consistent mathematical formulation. Then inspired by effective EA variants, we propose a novel pyramid EATFormer backbone that only contains the proposed EA-based transformer (EAT) block, which consists of three residual parts, i.e., Multi-scale region aggregation, global and local interaction, and feed-forward network modules, to model multi-scale, interactive, and individual information separately. Moreover, we design a task-related head docked with transformer backbone to complete final information fusion more flexibly and improve a modulated deformable MSA to dynamically model irregular locations. Massive quantitative and quantitative experiments on image classification, downstream tasks, and explanatory experiments demonstrate the effectiveness and superiority of our approach over state-of-the-art methods. E.g., our Mobile (1.8 M), Tiny (6.1 M), Small (24.3 M), and Base (49.0 M) models achieve 69.4, 78.4, 83.1, and 83.9 Top-1 only trained on ImageNet-1K with naive training recipe; EATFormer-Tiny/Small/Base armed Mask-R-CNN obtain 45.4/47.4/49.0 box AP and 41.4/42.9/44.2 mask AP on COCO detection, surpassing contemporary MPViT-T, Swin-T, and Swin-S by 0.6/1.4/0.5 box AP and 0.4/1.3/0.9 mask AP separately with less FLOPs; Our EATFormer-Small/Base achieve 47.3/49.3 mIoU on ADE20K by Upernet that exceeds Swin-T/S by 2.8/1.7. Code is available at https://github.com/zhangzjn/EATFormer.

연구 동기 및 목표

  • 비전 트랜스포머의 구조적 구성요소가 검증된 진화 알고리즘(EA) 연산자(예: 교배, 변이)와 수학적으로 동치임을 설명함으로써, EA 연산자와 자기주의/FFN 구성요소 간의 공통 수학적 형식을 규명한다.
  • 특히 글로벌 및 로컬 인구 모델링을 강조하는 효과적인 EA 변종을 통합하여 비전 트랜스포머의 특징 표현을 향상시킨다.
  • 제안된 EAT 블록으로만 구성된 새로운 피라미드 기반 EATFormer 백본을 설계하여 다중 스케일, 상호작용형, 개별 특징 모델링을 가능하게 한다.
  • 유연한 최종 융합을 위한 작업 관련 헤드(TRH)와 비정규적인 공간 위치를 동적으로 모델링하기 위한 조절 가능한 변형 가능 MSA(MD-MSA)를 도입한다.
  • 이미지 분류, 객체 검출, 세분화 작업 전반에 걸쳐 뛰어난 성능과 효율성을 입증하며, 추론 및 시각화 분석을 통해 설계 선택의 타당성을 검증한다.

제안 방법

  • 비전 트랜스포머의 멀티헤드 자기주의(MSA)와 진화 알고리즘(EA)의 교배 연산자 간 수학적 동치성을 유도한다. 또한 피드포워드 네트워크(FFN)와 EA의 변이 연산자 간의 수학적 동치성을 규명한다.
  • MSRA는 다중 스케일 특징 추출을 위해, GLI는 병렬 글로벌 및 로컬 모델링을 위해, FFN은 개별 특징 향상을 위해 통합된 잔차 아키텍처인 EAT 블록을 제안한다.
  • 작업 관련 헤드(TRH) 모듈을 도입하여 트랜스포머 백본에 도킹함으로써, 크로스 어텐션 메커니즘을 통해 태스크에 맞는 정보 융합을 가능하게 한다.
  • 조절 가능한 변형 가능 MSA(MD-MSA)를 설계하여 동적 샘플링 오프셋과 조절 가중치를 학습함으로써, 비정규적인 공간 구조에 대한 적응형 어텐션을 가능하게 한다.
  • EATFormer 백본의 성능 평가를 위해 ImageNet-1K에서 단순한 학습 레시피를 적용하고, GLI, MD-MSA, TRH의 추론 분석을 통해 각 구성 요소의 기여도를 검증한다.
  • 이미지 분류, COCO 객체 검출, ADE20K 세분화 작업에 대해 광범위한 실험을 수행하며, 어텐션 시각화 및 FLOPs/파라미터 분포 분석을 포함한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머의 구조적 구성요소가 교배 및 변이와 같은 진화 알고리즘 연산자와 공식적으로 연결될 수 있는가?
  • RQ2EA 변종에서 유래한 글로벌 및 로컬 인구 모델링을 통합함으로써 비전 트랜스포머의 특징 표현은 어떻게 향상되는가?
  • RQ3제안된 EAT 블록이 MSRA, GLI, FFN 구성요소를 갖추고 있을 때, 표준 ViT 블록 대비 다중 스케일 및 상호작용형 특징 학습은 어느 정도 향상되는가?
  • RQ4작업 관련 헤드(TRH)는 표준 분류 헤드에 비해 최종 특징 융합을 어떻게 향상시키는가?
  • RQ5MD-MSA 모듈은 표준 MSA에 비해 비정규적인 공간 위치를 더 효과적으로 동적으로 모델링할 수 있는가? 그리고 이는 고밀도 예측 작업에서 성능에 어떤 영향을 미치는가?

주요 결과

  • EATFormer-Base는 49.0M 파라미터로 단지 ImageNet-1K에서 83.9%의 Top-1 정확도를 기록하며, 동일한 학습 레시피를 사용한 SOTA 방법들을 초월한다.
  • EATFormer-Tiny, Small, Base는 각각 78.4%, 83.1%, 83.9%의 Top-1 정확도를 기록하여, 작은 모델 크기에서도 뛰어난 성능을 보인다.
  • COCO 객체 검출에서 EATFormer-Tiny/Small/Base는 상자 AP 45.4/47.4/49.0, 마스크 AP 41.4/42.9/44.2를 기록하며, Swin-T/S와 MPViT-T에 비해 각각 0.6/1.4/0.5 및 0.4/1.3/0.9 AP 높이면서도 더 적은 FLOPs를 사용한다.
  • ADE20K 세분화에서 EATFormer-Small/Base는 UperNet를 사용해 47.3/49.3 mIoU를 기록하며, Swin-T/S에 비해 각각 2.8/1.7 mIoU 높다.
  • 시각화 결과는 GLI가 특히 마지막 스테이지에서 넓은 영역에 주의를 기울여, 로컬 모델링이 없는 모델에서 관찰되는 희박한 영역에 대한 과도한 집중을 줄임을 확인한다.
  • 파라미터 및 FLOPs 분석 결과, FFN이 파라미터 수의 대부분을 차지하며, 초기 스테이지가 FLOPs의 대부분 기여를 한다. 이는 FFN 및 초기 레이어에서 최적화 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.