Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Convergence of DETR with Spatially Modulated Co-Attention

Peng Gao, Minghang Zheng|arXiv (Cornell University)|2021. 08. 05.
Advanced Neural Network Applications인용 수 15
한 줄 요약

이 논문은 공간적으로 조절된 공액 주의(SMCA)를 제안하며, 이는 디코더 내 공액 주의를 안내하기 위해 가우시안 유사 가중치 맵을 통한 위치 인지 공간 사전 지식을 도입함으로써 DETR의 수렴 속도를 가속화하는 플러그 앤 플레이 모듈이다. SMCA는 108 에포크에서 45.6 mAP를 달성하며, 500 에포크에서 43.3 mAP를 기록한 DETR를 능가한다. 아울러 구조적 변경을 최소화하면서도 훈련 시간을 크게 단축시켰다.

ABSTRACT

The recently proposed Detection Transformer (DETR) model successfully applies Transformer to objects detection and achieves comparable performance with two-stage object detection frameworks, such as Faster-RCNN. However, DETR suffers from its slow convergence. Training DETR from scratch needs 500 epochs to achieve a high accuracy. To accelerate its convergence, we propose a simple yet effective scheme for improving the DETR framework, namely Spatially Modulated Co-Attention (SMCA) mechanism. The core idea of SMCA is to conduct location-aware co-attention in DETR by constraining co-attention responses to be high near initially estimated bounding box locations. Our proposed SMCA increases DETR's convergence speed by replacing the original co-attention mechanism in the decoder while keeping other operations in DETR unchanged. Furthermore, by integrating multi-head and scale-selection attention designs into SMCA, our fully-fledged SMCA can achieve better performance compared to DETR with a dilated convolution-based backbone (45.6 mAP at 108 epochs vs. 43.3 mAP at 500 epochs). We perform extensive ablation studies on COCO dataset to validate SMCA. Code is released at https://github.com/gaopengcuhk/SMCA-DETR .

연구 동기 및 목표

  • DETR의 느린 수렴 문제를 해결하기 위해, 500 에포크가 필요로 하는 수렴을 개선하고자 한다.
  • 디코더를 제외한 DETR의 핵심 아키텍처를 변경하지 않고도 훈련 효율을 향상시키고자 한다.
  • 객체가 위치할 만한 영역을 안내하는 공간 사전 지식을 도입하여 검출 성능을 향상시키고자 한다.
  • 전역 자기 주의 및 다중 척도 특징 융합이 종료형 객체 검출의 수렴을 가속화하는 데 얼마나 효과적인지 탐색하고자 한다.

제안 방법

  • SMCA는 DETR 디코더 내 원래의 공액 주의 메커니즘을 대체하여, 동적으로 예측된 객체 중심 및 스케일을 사용해 2차원 가우시안 유사 공간 가중치 맵을 생성하는 공간적으로 조절된 버전을 도입한다.
  • 이러한 공간 가중치 맵은 공액 주의 특징 맵과 요소별 곱셈을 통해 수행되어, 예측된 객체 위치 근처 영역으로 주의를 제한함으로써 특징 집합 효율을 향상시킨다.
  • 이 방법은 디코더 내 다중 헤드 주의를 통합하며, 각 헤드가 독립적인 공간 사전 지식을 학습하여 개선된 특징 선택을 위한 다양한 수신장 영역을 가능하게 한다.
  • 하이브리드 인코더 아키텍처는 척도 내 및 다중 척도 자기 주의 메커니즘을 조합하여 척도 간 정보를 효율적으로 전파하면서도 FLOPs를 최소화한다.
  • 다중 척도 자기 주의는 모든 공간 위치 및 척도 간 상호작용을 가능하게 하여 특징의 구분 능력을 향상시킨다.
  • 디코더 내 척도 선택 주의를 통해 각 헤드는 관련된 특징 척도를 적응적으로 선택함으로써 검출의 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1학습 가능한 가우시안 유사 주의 맵을 통한 공간 사전 지식 도입이 DETR의 수렴 속도를 상당히 가속화할 수 있는가?
  • RQ2표준 DETR와 비교했을 때, 공액 주의의 공간 조절이 검출 정확도 및 훈련 효율에 어떤 영향을 미치는가?
  • RQ3다중 척도 자기 주의 및 다중 헤드 공간 조절이 기본 SMCA 모듈을 초월해 성능을 추가로 향상시킬 수 있는가?
  • RQ4Deformable DETR 및 TSP-RCNN과 같은 빠른 수렴 특성을 지닌 다른 검출기와 비교했을 때, SMCA는 mAP 및 다양한 크기의 객체에 대한 일반화 능력에서 어떤가?
  • RQ5전역 자기 주의 및 다중 척도 특징 융합의 통합은 국소 주의 메커니즘에 비해 큰 객체의 국소화 정확도를 향상시키는가?

주요 결과

  • 기본 SMCA 모듈은 50 에포크에서 41.0 mAP, 108 에포크에서 42.7 mAP를 기록하며, 500 에포크에서 43.3 mAP를 달성한 DETR를 뛰어넘는 성능을 보였다.
  • 전체 SMCA 모델은 108 에포크에서 45.6 mAP를 달성했으며, 이는 500 에포크에서 43.3 mAP를 기록한 DETR-DC5를 능가하는 성과이며, 훈련 시간은 45% 감소했다.
  • SMCA는 큰 객체에 대해 60.4 mAP를 기록하여 Deformable DETR의 59.0 mAP를 뛰어넘었으며, 국소 샘플링 대비 전역 주의의 우수성을 입증했다.
  • SMCA는 더 적은 백본 특징과 단순한 주의 메커니즘을 사용했음에도 불구하고, 109 에포크에서 45.6 mAP를 기록하여 Faster R-CNN-FPN-R50의 42.0 mAP를 능가했다.
  • 2-intra-inter-2-intra 자기 주의 설계를 가진 하이브리드 인코더는 순수한 다중 척도 또는 척도 내 인코더보다 더 적은 파라미터와 낮은 FLOPs로 43.7 mAP를 달성했다.
  • SMCA는 50 에포크에서 TSP-RCNN과 유사한 mAP(43.7 vs. 43.8)를 기록했으나, 더 긴 스케줄에서 더 뛰어난 성능을 보였다(96 및 108 에포크에서 45.6 vs. 45.0 mAP), 이는 장기 수렴 성능이 뛰어나다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.