Skip to main content
QUICK REVIEW

[논문 리뷰] Miti-DETR: Object Detection based on Transformers with Mitigatory Self-Attention Convergence

Wenchi Ma, Tianxiao Zhang|arXiv (Cornell University)|2021. 12. 26.
Advanced Neural Network Applications인용 수 6
한 줄 요약

Miti-DETR는 트랜스포머에서의 랭크 붕괴를 완화하기 위해 입력 토큰을 각 다중헤드 자기주의층의 출력에 직접 연결하는 잔차 자기주의 메커니즘을 제안한다. 이로 인해 COCO 객체 검출에서 수렴 속도가 크게 향상되고 평균 정밀도가 최대 3% 향상되며, 모델 크기나 추론 시간의 증가 없이도 성능 향상을 달성한다.

ABSTRACT

Object Detection with Transformers (DETR) and related works reach or even surpass the highly-optimized Faster-RCNN baseline with self-attention network architectures. Inspired by the evidence that pure self-attention possesses a strong inductive bias that leads to the transformer losing the expressive power with respect to network depth, we propose a transformer architecture with a mitigatory self-attention mechanism by applying possible direct mapping connections in the transformer architecture to mitigate the rank collapse so as to counteract feature expression loss and enhance the model performance. We apply this proposal in object detection tasks and develop a model named Miti-DETR. Miti-DETR reserves the inputs of each single attention layer to the outputs of that layer so that the "non-attention" information has participated in any attention propagation. The formed residual self-attention network addresses two critical issues: (1) stop the self-attention networks from degenerating to rank-1 to the maximized degree; and (2) further diversify the path distribution of parameter update so that easier attention learning is expected. Miti-DETR significantly enhances the average detection precision and convergence speed towards existing DETR-based models on the challenging COCO object detection dataset. Moreover, the proposed transformer with the residual self-attention network can be easily generalized or plugged in other related task models without specific customization.

연구 동기 및 목표

  • 깊이가 증가할수록 특징 표현 능력이 떨어지는 순수 자기주의 네트워크에서의 본질적 랭크 붕괴 문제를 해결한다.
  • 데이터나 하이퍼파라미터 조정 없이 DETR 기반 모델의 학습 안정성과 수렴 속도를 향상시킨다.
  • 소형 및 대형 객체에 특히 유리하게 전역 특징 표현을 유지함으로써 검출 성능을 향상시킨다.
  • 기존 트랜스포머 기반 객체 검출 및 관련 작업에 일반화 가능한 플러그 앤 플레이 모듈을 개발한다.
  • 모델 크기나 추론 비용을 늘리지 않고도 기존 방법을 초월하는 트랜스포머 내부의 아키텍처 수정이 가능함을 입증한다.

제안 방법

  • 각 다중헤드 자기주의층의 입력을 피드포워드 네트워크를 건너뛰어 출력에 직접 연결하는 잔차 연결을 도입한다.
  • 스킵 연결을 통해 자기주의 출력이 랭크-1 행렬로 붕괴되는 것을 방지하기 위해 비자기주의 특징을 유지한다.
  • 자기주의 출력의 랭크-1 수렴 경향을 상쇄함으로써 깊은 네트워크에서도 표현 능력을 유지하는 잔차 자기주의 네트워크를 구성한다.
  • 아키텍처의 대대적 개조 없이 DETR 트랜스포머 인코더 및 디코더 스택 내부에 잔차 자기주의 모듈을 적용한다.
  • 표준 학습 프로토콜을 사용해 COCO에서 엔드 투 엔드로 모델을 학습시켜 수렴성과 검출 성능을 평가한다.
  • 기본 모델인 DETR와 동일한 파라미터 수와 추론 시간을 유지함으로써 기존 DETR 프레임워크와의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1잔차 자기주의 메커니즘이 자기주의 네트워크에서의 랭크 붕괴를 완화하고 깊은 트랜스포머에서의 특징 표현 능력을 향상시킬 수 있는가?
  • RQ2제안된 잔차 연결이 DETR 기반 객체 검출기에서 수렴 속도를 가속화하고 학습을 안정화시키는가?
  • RQ3Miti-DETR는 COCO에서 특히 소형 및 대형 객체에 대해 얼마나 향상된 검출 정확도를 보이는가?
  • RQ4잔차 자기주의 모듈은 재학습이나 아키텍처 변경 없이도 다른 트랜스포머 기반 모델로 일반화 가능한가?
  • RQ5기본 모델인 DETR 및 UP-DETR과 비교해 성능 향상을 달성하면서도 추론 속도와 모델 크기를 유지하는가?

주요 결과

  • Miti-DETR는 COCO 데이터셋에서 원본 DETR 대비 평균 정밀도(AP)를 약 3% 향상시키며, IoU 임계치 0.75일 때 AP75는 4% 향상된다.
  • 모델는 수렴 속도가 크게 향상되어 안정적인 학습 곡선을 보이며, 학습률 스케줄링 중 성능 발산 현상이 관찰되지 않는다.
  • 시각화 결과에서 오분류된 양복 끈이나 비행기 등의 오진 검출을 줄였으며, 이는 국소화 정확도 향상을 시사한다.
  • 모델의 파라미터 수와 거의 동일한 추론 시간을 유지하며, UP-DETR는 모델 크기를 늘리고 속도를 감소시킨다.
  • 제한된 에포크 수와 GPU 자원 조건에서도 Miti-DETR는 UP-DETR를 능가하는 뛰어난 강인성을 보였다.
  • 잔차 자기주의 메커니즘은 특히 소형 객체 검출에 유리한 전역 특징 표현을 가능하게 하여, 성능 향상이 가장 두드러진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.