Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Group Transformer: A General Vision Transformer Backbone with Dynamic Group Attention

Kai Liu, Tianyi Wu|arXiv (Cornell University)|2022. 03. 08.
Advanced Image and Video Retrieval Techniques인용 수 4
한 줄 요약

이 논문은 고정 윈도우 자기주의를 동적 그룹 주의(DG-Attention)로 대체하는 일반적인 비전 트랜스포머 백본인 동적 그룹 트랜스포머(Dynamic Group Transformer, DGT)를 제안한다. DG-Attention는 쿼리들을 콘텐츠 유사성 기반으로 자동으로 군집화하고 각 그룹에 대해 관련성이 높은 키/벨류를 선택한다. 이 방법은 이미지 분류, 세분화, 객체 검출, 인스턴스 세분화 등 다양한 작업에서 최신 기술(SOTA) 수준의 성능을 달성하며, DGT-T는 ImageNet-1k에서 83.8%의 Top-1 정확도를 기록하고 DGT-B는 85.0%의 Top-1 정확도를 달성한다.

ABSTRACT

Recently, Transformers have shown promising performance in various vision tasks. To reduce the quadratic computation complexity caused by each query attending to all keys/values, various methods have constrained the range of attention within local regions, where each query only attends to keys/values within a hand-crafted window. However, these hand-crafted window partition mechanisms are data-agnostic and ignore their input content, so it is likely that one query maybe attends to irrelevant keys/values. To address this issue, we propose a Dynamic Group Attention (DG-Attention), which dynamically divides all queries into multiple groups and selects the most relevant keys/values for each group. Our DG-Attention can flexibly model more relevant dependencies without any spatial constraint that is used in hand-crafted window based attention. Built on the DG-Attention, we develop a general vision transformer backbone named Dynamic Group Transformer (DGT). Extensive experiments show that our models can outperform the state-of-the-art methods on multiple common vision tasks, including image classification, semantic segmentation, object detection, and instance segmentation.

연구 동기 및 목표

  • 비전 트랜스포머에서 고정 윈도우 주의 메커니즘이 데이터에 무관하고 관련 없는 키/벨류에 주의를 기울일 수 있는 한계를 해결하기 위해.
  • 전역 자기주의의 이차적 계산 복잡도를 줄이면서도 장거리 의존성 모델링을 유지하기 위해.
  • 공간적 제약 없이 쿼리를 유연하고 콘텐츠 기반으로 군집화하고 관련성이 높은 키/벨류를 선택하는 동적 주의 메커니즘을 개발하기 위해.
  • 다양한 비전 작업에서 경쟁적인 성능을 내는 일반 목적의 비전 트랜스포머 백본을 설계하기 위해.

제안 방법

  • 동적 그룹 주의(DG-Attention)는 쿼리들이 학습된 군집 중심점과의 유사성 기반으로 자동으로 그룹으로 분할되며, 콘텐츠 인식 기반의 그룹화를 가능하게 한다.
  • 각 그룹에 대해 군집 중심점이 전체 키/벨류 세트에서 가장 관련성이 높은 부분집합을 선택함으로써 관련 없는 주의를 줄인다.
  • 선택된 키들이 국소 윈도우에 국한되지 않고 특징 맵 전반에 산재해 있을 수 있도록 하여 공간적 제약을 피한다.
  • 군집화와 주의의 공동 최적화를 가능하게 하기 위해 기울기 역전파가 가능한 미분 가능하고 종단 간 훈련이 가능한 메커니즘이다.
  • 각 그룹의 주의 범위를 제한하고 그룹 별 행렬 곱셈을 사용함으로써 계산 효율성을 유지한다.
  • DGT 백본은 24M, 52M, 90M 파라미터를 갖는 DGT-T, DGT-S, DGT-B 버전으로 스케일링되어 다양한 배포 요구에 대응한다.

실험 결과

연구 질문

  • RQ1입력 기반의 쿼리 군집화에 기반해 관련 키를 동적으로 선택함으로써, 콘텐츠 적응형 주의 메커니즘이 고정 윈도우 주의보다 비전 트랜스포머에서 더 나은 성능을 낼 수 있는가?
  • RQ2쿼리의 동적 군집화가 고해상도 특징 맵에서 장거리 의존성을 유지하면서 계산 비용을 어떻게 줄일 수 있는가?
  • RQ3동적 군집화 기반의 일반 목적 비전 트랜스포머 백본이 다양한 비전 작업에서 최신 기술(SOTA) 성능을 달성할 수 있는 정도는 어느 정도인가?
  • RQ4키 선택 시 공간적 제약이 없을 경우, 비국소적이고 의미적으로 관련성이 높은 특징을 더 잘 모델링할 수 있는가?

주요 결과

  • DGT-T는 ImageNet-1k에서 83.8%의 Top-1 정확도를 기록하여 이전 최신 기술(SOTA) 방법을 능가한다.
  • ADE20K 데이터셋에서 DGT-T는 세분화 작업에 대해 50.2%의 mIoU를 기록하며 기존 방법을 능가한다.
  • COCO에서의 객체 검출 작업에서 DGT-T는 47.7%의 박스 mAP를 달성하여 고밀도 예측 작업에서 강력한 일반화 성능을 보였다.
  • DGT-B는 ImageNet-1k에서 85.0%의 Top-1 정확도와 ADE20K에서 51.2%의 mIoU를 기록하여 분류 및 세분화 분야에서 새로운 최신 기술(SOTA) 기록을 수립했다.
  • 시각화 결과는 서로 다른 쿼리 그룹이 국소 윈도우에 국한되지 않고 산만하게 산재해 있는 의미적으로 관련성이 높은 키들에 주의를 기울이고 있음을 확인한다.
  • 제안된 그룹 별 행렬 곱셈 구현은 전역 메모리 사용을 줄이고 효율적인 GPU 계산을 가능하게 하여 확장 가능한 훈련 및 추론을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.