Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Transformer with Deformable Attention

Zhuofan Xia, Xuran Pan|arXiv (Cornell University)|2022. 01. 03.
Advanced Neural Network Applications인용 수 15
한 줄 요약

이 논문은 Deformable Attention Transformer (DAT)을 제안하며, 쿼리 그룹당 공유 오프셋을 통해 데이터에 의존하는 키/밸류 샘플링 위치를 학습하는 새로운 변형 가능한 자기주의 메커니즘을 갖춘 비전 트랜스포머 백본을 제공한다. 이는 효율적이고 적응적인 주의를 가능하게 한다. 이 방법은 스위니 트랜스포머와 같은 강력한 베이스라인에 비해 ImageNet에서 0.7% 향상된 정확도, ADE20K 세그멘테이션에서 1.2%, COCO 검출에서 1.1% 향상된 최신 기술 성능을 달성한다.

ABSTRACT

Transformers have recently shown superior performances on various vision tasks. The large, sometimes even global, receptive field endows Transformer models with higher representation power over their CNN counterparts. Nevertheless, simply enlarging receptive field also gives rise to several concerns. On the one hand, using dense attention e.g., in ViT, leads to excessive memory and computational cost, and features can be influenced by irrelevant parts which are beyond the region of interests. On the other hand, the sparse attention adopted in PVT or Swin Transformer is data agnostic and may limit the ability to model long range relations. To mitigate these issues, we propose a novel deformable self-attention module, where the positions of key and value pairs in self-attention are selected in a data-dependent way. This flexible scheme enables the self-attention module to focus on relevant regions and capture more informative features. On this basis, we present Deformable Attention Transformer, a general backbone model with deformable attention for both image classification and dense prediction tasks. Extensive experiments show that our models achieve consistently improved results on comprehensive benchmarks. Code is available at https://github.com/LeapLabTHU/DAT.

연구 동기 및 목표

  • 표준 비전 트랜스포머와 스위니 트랜스포머와 같은 희소 주의 메커니즘에서의 비효율성과 최적화되지 않은 주의 분포 문제를 해결하기 위해.
  • 관련 특징를 버리거나 불필요한 특징를 유지할 수 있는 데이터 무관 주의 패턴의 한계를 극복하기 위해.
  • 계산 복잡도가 제곱적으로 증가하지 않도록, 입력 콘텐츠에 적응하는 미분 가능하고 효율적인 변형 가능한 주의 메커니즘을 도입하기 위해.
  • 분류 및 조밀한 예측 작업 전반에서 기존 비전 트랜스포머를 일관되게 능가하는 일반 목적의 컨volution 프리 백본 모델을 설계하기 위해.

제안 방법

  • 쿼리 특징에서 생성된 학습 가능한 오프셋을 통해 키 및 밸류 위치를 이동시키는 변형 가능한 자기주의 모듈을 제안하며, 이는 데이터에 의존하는 주의를 가능하게 한다.
  • 모든 쿼리에 대해 공유되고 쿼리에 의존하지 않는 오프셋을 도입함으로써 메모리 및 계산 비용을 감소시키면서도 유연성을 유지한다.
  • 일관된 기준점들을 초기 샘플링 위치로 사용하며, 이는 쿼리 특징에 조건부인 오프셋 네트워크를 통해 변형된다.
  • 쿼리에 기반해 각 기준점에 대한 이동을 예측하는 경량 오프셋 네트워크를 활용하여, 주목할 만한 영역에 동적으로 집중할 수 있도록 한다.
  • 이미지 분류 및 조밀한 예측 작업에 모두 적합한 피라미드형 백본인 변형 가능한 주의 트랜스포머(DAT)를 구축한다.
  • 각 쿼리별 오프셋 학습을 피하기 때문에, 기존의 컨volution 기반 변형 가능한 컨볼루션 또는 트랜스포머 내의 이전 변형 가능한 주의와 달리 선형 공간 복잡도를 유지한다.

실험 결과

연구 질문

  • RQ1데이터에 의존하는 주의 메커니즘이 계산 효율성을 유지하면서도 비전 트랜스포머의 특징 표현을 향상시킬 수 있는가?
  • RQ2쿼리에 의존하지 않는 공유 오프셋을 학습하는 방식이 쿼리별 또는 고정 패턴 주의 방식에 비해 성능 및 효율성 측면에서 어떻게 비교되는가?
  • RQ3변형 가능한 주의가 이미지 인식 작업에서 장거리 의존성과 객체 특화 특징을 얼마나 잘 모델링하는가?
  • RQ4변형 가능한 주의 메커니즘은 컨볼루션 성분을 도입하지 않고 순수한 트랜스포머 백본에 효과적으로 통합될 수 있는가?

주요 결과

  • DAT는 ImageNet-1K에서 82.0%의 top-1 정확도를 달성하며, 유사한 FLOPs 및 파라미터 수에서 스위니 트랜스포머를 0.7% 초월한다.
  • ADE20K 세그멘테이션 벤치마크에서 DAT는 경쟁적 기준선 대비 mIoU를 1.2% 향상시키며, 특히 작은 물체와 큰 물체에서 높은 성과를 기록(최대 2.1% 향상).
  • COCO 객체 검출에서 DAT는 상자 AP와 마스크 AP 모두 스위니 트랜스포머 대비 1.1% 향상되어 검출 및 세그멘테이션 작업 전반에서 일관된 성능 향상을 보였다.
  • 컨볼루션 패치 임베딩을 사용한 모델(DAT-T*)은 ImageNet에서 82.7%의 top-1 정확도를 기록했으며, 원본 DAT-T 대비 0.7% 향상되었고, 최고의 기준선 대비도 0.7% 향상되었다.
  • 시각화 결과는 변형 가능한 주의가 배경이 아닌 전경 객체 및 기하학적으로 복잡한 영역(예: 여러 개의 도넛 또는 기린)에 집중하는 반면, 스위니 트랜스포머는 국소적이고 덜 관련성이 있는 패치에 주로 집중하는 경향이 있음을 확인했다.
  • 메모리 및 FLOP 분석 결과, 유사한 키 수를 가진 D-DETR 대비 DAT는 2.6배 적은 메모리와 1.3배 적은 FLOPs를 사용하면서도 더 높은 정확도를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.