Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Transformer for Object Detection

Michael Ying Yang|arXiv (Cornell University)|2022. 06. 01.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

이 논문은 전역적 맥락 모델링과 객체 정렬을 향상시키기 위해 겹치는 이미지 패치를 사용하는 비전 트랜스포머 기반 객체 검출기인 DetTransNet을 제안한다. 기존의 컨볼루션 레이어를 자기주의 메커니즘으로 대체하고, 특징의 풍부함을 고려한 패치 전략을 최적화함으로써 DetTransNet은 COCO에서 SOTA 성능을 달성하며, 45.4 mAP를 기록하여 De-DETR를 1.6 mAP 뛰어넘었다.

ABSTRACT

Convolutional Neural networks (CNN) have been the first choice of paradigm in many computer vision applications. The convolution operation however has a significant weakness which is it only operates on a local neighborhood of pixels, thus it misses global information of the surrounding neighbors. Transformers, or Self-attention networks to be more specific, on the other hand, have emerged as a recent advance to capture long range interactions of the input, but they have mostly been applied to sequence modeling tasks such as Neural Machine Translation, Image captioning and other Natural Language Processing tasks. Transformers has been applied to natural language related tasks and achieved promising results. However, its applications in visual related tasks are far from being satisfying. Taking into consideration of both the weaknesses of Convolutional Neural Networks and those of the Transformers, in this paper, we consider the use of self-attention for discriminative visual tasks, object detection, as an alternative to convolutions. In this paper, we propose our model: DetTransNet. Extensive experiments show that our model leads to consistent improvements in object detection on COCO across many different models and scales, including ResNets, while keeping the number of parameters similar. In particular, our method achieves a 1.2% Average Precision improvement on COCO object detection task over other baseline models.

연구 동기 및 목표

  • 컨volutional 연산을 자기주의 메커니즘으로 대체하여 CNN이 전역 이미지 맥락을 포착하는 데 한계를 극복하고자 한다.
  • 특히 작은 객체에서의 성능이 열악한 표준 비전 트랜스포머의 문제를 패치 전략을 재설계하여 해결하고자 한다.
  • CNN 기반 검출기의 정확도를 유지하거나 초월하면서도 유사한 파라미터 수를 유지하는 비전 트랜스포머 기반 객체 검출기를 개발하고자 한다.
  • 더 풍부한 국소 및 전역 특징 표현을 위해 겹치는 패치를 활용하여 학습 효율성과 일반화 능력을 향상시키고자 한다.

제안 방법

  • 각 패치가 이웃 패치와 m 픽셀을 공유하도록 겹치는 이미지 패치를 도입하여 국소 구조 모델링과 특징의 연속성을 향상시킨다.
  • 학습 가능한 위치 임베딩을 갖춘 비전 트랜스포머 백본을 사용하여 겹치는 패치 시퀀스를 처리함으로써 이미지 전반에 걸친 장거리 주의를 가능하게 한다.
  • Faster R-CNN와 유사하게 완전 컨volution 레이어를 갖춘 영역 제안 네트워크(RPN)를 사용하여 객체 제안을 생성하지만, ViT 인코더에서 제공하는 특징을 입력으로 사용한다.
  • 하이브리드 학습 전략을 적용: 먼저 RPN을 사전학습하고, 이후 Adam 옵timizer와 가중치 감소를 사용하여 ViT와 RPN을 함께 미세조정한다.
  • 더 작은 COCO 데이터셋에서의 일반화 능력을 향상시키기 위해 ImageNet과 JFT에서 대규모 사전학습을 수행한다.
  • 공간 차원을 평탄화하고 모델의 은닉 차원으로 투영하는 패치 투영 헤드를 활용하여 트랜스포머의 입력 시퀀스를 구성한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 객체 검출기가 Faster R-CNN와 같은 CNN 기반 검출기보다 객체 검출 정확도에서 뛰어날 수 있는가?
  • RQ2비전 트랜스포머에 겹치는 패치를 사용하면 특징 표현과 검출 성능, 특히 작은 객체에 대해 향상되는가?
  • RQ3컨volutional 인덕티브 바이어스에 의존하지 않고 순수한 트랜스포머 아키텍처가 강력한 성능을 달성할 수 있는가?
  • RQ4기존의 겹치지 않는 패치 전략에 비해 제안된 겹치는 패치 전략은 학습 효율성과 일반화 능력 측면에서 어떻게 비교되는가?

주요 결과

  • DetTransNet은 COCO 2017 객체 검출 데이터셋에서 45.4 mAP를 달성하여 새로운 SOTA 성능을 기록했다.
  • De-DETR 대비 1.2% 향상된 mAP와 이전 최고 성능 기준인 De-DETR 대비 1.6% 향상된 mAP를 기록했다.
  • 겹치는 패치 전략은 작은 객체 검출 성능을 향상시켜 AP_small을 De-DETR의 21.2에서 22.5로 상승시켰다.
  • 모델의 파라미터 수는 ResNet 기반 검출기와 유사하여 성능을 저하시키지 않은 채 효율성을 유지했다.
  • ImageNet과 JFT에서의 사전학습은 성능 향상에 크게 기여했으며, 비전 트랜스포머의 경우 대규모 사전학습의 중요성을 입증했다.
  • 제거 분석 결과, 겹치는 패치 전략은 표준 패치 전략 대비 특징의 풍부함을 높이고 학습의 불안정성을 감소시킴을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.