Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Transformer with Attention Map Hallucination and FFN Compaction

Haiyang Xu, Zhichao Zhou|arXiv (Cornell University)|2023. 06. 19.
CCD and CMOS Imaging SensorsEngineering인용 수 3
한 줄 요약

이 논문은 주어진 시각 Transformer의 복잡도를 줄이기 위해 attention 맵과 피드포워드 네트워크 내의 부재를 활용하여 환영된-MHSA(hMHSA)와 컴act-FFN(cFFN)을 제안한다. hMHSA는 다른 반쪽의 결과로부터 저비용 연산을 통해 반의 attention 맵을 생성함으로써 전체 Q-K 상관관계 계산을 피한다. 반면 cFFN은 행렬 분해와 재매개변수화를 사용하여 FFN을 압축함으로써 DeiT, NextViT, PVT 백본에서 10%-20%의 FLOPs와 파라미터 감소를 달성하면서도 경쟁 가능한 정확도를 유지한다.

ABSTRACT

Vision Transformer(ViT) is now dominating many vision tasks. The drawback of quadratic complexity of its token-wise multi-head self-attention (MHSA), is extensively addressed via either token sparsification or dimension reduction (in spatial or channel). However, the therein redundancy of MHSA is usually overlooked and so is the feed-forward network (FFN). To this end, we propose attention map hallucination and FFN compaction to fill in the blank. Specifically, we observe similar attention maps exist in vanilla ViT and propose to hallucinate half of the attention maps from the rest with much cheaper operations, which is called hallucinated-MHSA (hMHSA). As for FFN, we factorize its hidden-to-output projection matrix and leverage the re-parameterization technique to strengthen its capability, making it compact-FFN (cFFN). With our proposed modules, a 10$\%$-20$\%$ reduction of floating point operations (FLOPs) and parameters (Params) is achieved for various ViT-based backbones, including straight (DeiT), hybrid (NextViT) and hierarchical (PVT) structures, meanwhile, the performances are quite competitive.

연구 동기 및 목표

  • 시각 Transformer의 다중 헤드 자기주의(MHSA) 및 피드포워드 네트워크(FFN) 구성요소에서 간과된 부재를 다루기 위해.
  • 모델 성능을 훼손하지 않으면서 계산 복잡도(FLOPs 및 파라미터)를 감소시키기 위해.
  • MHSA의 attention 맵들이 상관관계가 있으며, 전체적으로 계산하는 대신 환영( hallucinated ) 방식으로 생성할 수 있는지 탐색하기 위해.
  • 행렬 분해와 재매개변수화를 활용하여 FFN을 재설계하여 압축성과 함께 표현 능력을 유지하기 위해.
  • 직선형(DeiT), 하이브리드(NextViT), 계층적(PVT) 등 다양한 ViT 아키텍처에서 제안된 모듈의 유효성을 검증하기 위해.

제안 방법

  • 다른 반쪽의 결과로부터 저비용 연산을 사용해 반의 attention 맵을 생성함으로써 전체 Q-K 상관관계 계산을 피하는 환영된-MHSA(hMHSA)를 제안한다.
  • FFN의 히든-아웃풋 투영 행렬에 대해 행렬 분해를 적용하여 부재를 억제하고 파라미터 수를 감소시킨다.
  • 분해된 FFN에 재매개변수화 기법을 적용하여, 복수의 학습 단계 브랜치에서 유도된 단일 강력한 추론 단계 전방향 전파를 가능하게 한다.
  • cFFN의 압축 정도를 제어하기 위해 압축 비율 t를 사용하며, 정확도-효율성 균형을 고려해 t=2/3를 최적의 값으로 선정한다.
  • DeiT, NextViT, PVTv2 등 다양한 ViT 백본에 hMHSA와 cFFN을 적용하여 경쟁 가능한 성능 유지를 달성한다.
  • 재매개변수화 브랜치 수(r), 다양한 행렬(M1 대비 M2)에 대한 분해 영향, 압축 비율(t)의 영향을 평가하기 위해 분석 실험을 실시한다.

실험 결과

연구 질문

  • RQ1MHSA의 부재 attention 맵을 전체 Q-K 상관관계 계산 없이 저비용 연산을 통해 효과적으로 환영할 수 있는가?
  • RQ2FFN 투영 행렬의 행렬 분해가 부재를 감소시키면서도 모델의 표현 능력을 유지하는가?
  • RQ3재매개변수화 기법이 추론 비용을 증가시키지 않으면서도, 압축된 FFN의 성능을 어떻게 향상시키는가?
  • RQ4제안된 cFFN 모듈에서 압축 비율과 정확도 사이의 최적 균형은 무엇인가?
  • RQ5hMHSA와 cFFN는 직선형, 하이브리드, 계층적 아키텍처를 포함한 다양한 ViT 아키텍처에 효과적으로 일반화될 수 있는가?

주요 결과

  • hMHSA는 반의 attention 맵을 다른 반쪽에서 환영함으로써 MHSA 계산을 줄여 높은 FLOPs 및 파라미터 절감을 달성하면서도 성능 저하를 최소화한다.
  • 행렬 분해와 재매개변수화를 적용한 cFFN은 다양한 ViT 백본에서 10%-20%의 FLOPs 및 파라미터 감소를 이끌어내며 경쟁 가능한 정확도를 유지한다.
  • 분석 실험 결과, 히든-아웃풋 투영 행렬(M2)에 대한 분해가 입력-히든 행렬(M1)에 대한 분해보다 더 높은 성능을 보이며 0.2%의 정확도 향상을 달성한다.
  • cFFN에서 r=2의 재매개변수화 브랜치를 사용할 경우 성능과 학습 비용 간 최적의 균형을 이룬다. r=1 및 r=3보다 뛰어난 성능을 기록한다.
  • cFFN의 최적 압축 비율 t=2/3는 PVTv2-b1에서 70.2%의 top-1 정확도를 달성하며, FLOPs 및 파라미터가 동일한 조건에서 기준 모델보다 0.3% 높은 성능을 보였다.
  • CIFAR-100 및 Stanford-Dog에서의 전이 학습 결과, 제안된 모델들이 원본 모델과 동일하거나 略적으로 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.