Skip to main content
QUICK REVIEW

[논문 리뷰] Class-agnostic Object Detection with Multi-modal Transformer

Muhammad Maaz, Hanoona Rasheed|arXiv (Cornell University)|2021. 11. 22.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 이미지-텍스트 쌍으로 훈련된 다중모달 시각 트랜스포머(MViTs)를 사용하여 다양한 도메인에서 고품질의 객체 제안을 생성하는 클래스에 관계없는 객체 검출 방법을 제안한다. 자연어 질의를 활용하여 객체 제안을 생성함으로써, 주로 훈련 중 언어의 구조적 의미가 기여하는 바가 크며, 이는 캡션을 제거한 경우에도 성능이 유지됨을 시사한다. 핵심 기여는 MViTs가 클래스별 지도 없이도 최신 기술 수준의 성능을 달성할 수 있음을 입증한 것으로, 언어의 어휘적 내용보다 언어의 구조적 특성이 더 중요함을 보여준다.

ABSTRACT

What constitutes an object? This has been a long-standing question in computer vision. Towards this goal, numerous learning-free and learning-based approaches have been developed to score objectness. However, they generally do not scale well across new domains and novel objects. In this paper, we advocate that existing methods lack a top-down supervision signal governed by human-understandable semantics. For the first time in literature, we demonstrate that Multi-modal Vision Transformers (MViT) trained with aligned image-text pairs can effectively bridge this gap. Our extensive experiments across various domains and novel objects show the state-of-the-art performance of MViTs to localize generic objects in images. Based on the observation that existing MViTs do not include multi-scale feature processing and usually require longer training schedules, we develop an efficient MViT architecture using multi-scale deformable attention and late vision-language fusion. We show the significance of MViT proposals in a diverse range of applications including open-world object detection, salient and camouflage object detection, supervised and self-supervised detection tasks. Further, MViTs can adaptively generate proposals given a specific language query and thus offer enhanced interactability. Code: \url{https://git.io/J1HPY}.

연구 동기 및 목표

  • 다양한 도메인과 새로운 객체에 대해 확장 가능하고 일반화 가능한 솔루션이 부족한 클래스에 관계없는 객체 검출 문제를 해결하기 위해.
  • 이미지-텍스트 쌍으로 훈련된 다중모달 시각 트랜스포머(MViTs)가 클래스별 지도 없이도 효과적이고 일반적인 객체 제안 생성기로 기능할 수 있는지 조사하기 위해.
  • 시각 모델에서 일반적인 객체 개념으로의 일반화를 가능하게 하는 언어의 구조적 특성과 어휘적 내용의 기여도를 탐색하기 위해.
  • 다중 스케일 변형 가능 어텐션과 후기 융합을 통합한 효율적이고 유연한 MViT 아키텍처(MAVL)를 개발하여 객체 정위치를 향상시키기 위해.
  • MViT 기반 제안이 개방형 세계 검출, 주목할 만한 객체 검출 및 자기지도 학습과 같은 후행 작업에서 어떻게 활용될 수 있는지 보여주기 위해.

제안 방법

  • 이 방법은 대규모 이미지-텍스트 데이터셋에서 이미지-캡션 쌍이 정렬된 상태로 사전 훈련된 다중모달 시각 트랜스포머(MViT) 아키텍처를 사용한다.
  • 다중 스케일 특징 추출을 위한 변형 가능 어텐션과 후기 단계에서 시각 및 언어 표현을 융합하는 방식으로 정교화된 새로운 아키텍처인 다중 스케일 어텐션 ViT와 후기 융합(MAVL)이 도입되어 정위치 정확도를 향상시킨다.
  • 자연어 질의 예를 들어 '모든 객체' 또는 도메인 전용 용어를 사용하여 MViT에 프롬프트를 제공함으로써 상호작용적이고 적응형 제안 생성이 가능하다.
  • 캡션을 훈련 중에 제거하더라도, 시각적 영역과 해당 텍스트 기술을 정렬하는 대비 학습 목표를 통해 모델을 종합적으로 훈련시킨다.
  • 언어의 구조적 기여를 분리하기 위해 텍스트 입력을 제거하면서 데이터 로더의 구조를 유지하는 방식으로 추론 실험을 수행한다.
  • 표준 검출 벤치마크를 사용하여 자연 이미지, 위성 영상, 스케치, 그림 등 다양한 도메인에서 평가한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 다중모달 시각 트랜스포머(MViTs)가 클래스별 지도 없이도 클래스에 관계없는 객체 검출에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2일반적인 객체 개념으로의 일반화를 가능하게 하는 데 있어 언어 의미와 언어 구조(예: 순서 및 반복 패턴)의 상대적 기여는 어떠한가?
  • RQ3다중 스케일 변형 가능 어텐션과 후기 융합을 통합한 제안된 MAVL 아키텍처는 표준 MViTs에 비해 객체 정위치에 어떻게 향상되는가?
  • RQ4MViT가 생성한 제안이 개방형 세계 검출, 주목할 만한 객체 검출, 자기지도 학습과 같은 후행 작업에서 성능 향상에 얼마나 기여하는가?
  • RQ5간단한 자연어 질의로 프롬프트된 MViTs가 새로운 객체 카테고리와 도메인(예: 스케치, 그림)으로 일반화할 수 있는가?

주요 결과

  • MAVL은 자연 이미지, 위성 영상, 스케치, 그림 등 다양한 도메인에서 바닥에서부터 제안하는 방법과 표준 MViTs를 모두 초월하여 클래스에 관계없는 객체 검출에서 최신 기술 수준의 성능을 달성한다.
  • 훈련 중에 텍스트 캡션을 완전히 제거한 경우에도 모델이 강력한 일반화 성능 유지를 유지함으로써, 언어의 어휘적 내용보다 언어의 구조적 특성(예: 다양한 맥락에서 반복적으로 이미지 방문)이 더 중요함을 시사한다.
  • 추론 실험 결과, 이미지당 여러 캡션을 유지하면서 맥락을 다양화한 언어 구조를 보존할 경우, Pascal-VOC에서 AP50가 16.2에서 61.6으로 25.5점 향상됨을 확인하였다(모든 구조 제거 시 대비).
  • DETReg 사전 훈련에서 Selective Search 대신 상위 30개의 MViT 제안을 사용함으로써 비지도 객체 정위치 성능이 향상되었으며, 이는 MViT 제안의 품질을 입증한다.
  • 주목할 만한 객체 및 카모플라주 객체 검출 작업에서, 작업 전용 텍스트 질의를 사용함으로써 완전히 지도 학습된 모델에 경쟁 가능한 성능을 달성하였고, 작업 전용 미세조정이 전혀 필요 없었다.
  • 이미지-캡션 쌍을 통한 사전 훈련 과정에서 인코딩된 의미적 및 공간적 맥락 덕분에, 모델은 새로운 객체 카테고리와 도메인(스케치, 그림 포함)으로도 효과적으로 일반화된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.