Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Grounding with Transformers

Ye Du, Zehua Fu|arXiv (Cornell University)|2021. 05. 10.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

이 논문은 사전에 학습된 객체 검출기나 언어 모델에 의존하지 않는, 시각적 기반을 위한 새로운 엔드 투 엔드 트랜스포머 기반 프레임워크인 VGTR을 제안한다. 언어 의미와 정렬된 맥락 인식 시각적 특징을 학습하기 위해 텍스트 유도형 자기주의를 도입함으로써, VGTR는 네 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 이전의 제안 없음 기반 방법들보다 뚜렷한 성능 향상을 보이며, 특히 Flickr30K Entities에서 4.89%의 정확도 향상을 기록한다.

ABSTRACT

In this paper, we propose a transformer based approach for visual grounding. Unlike previous proposal-and-rank frameworks that rely heavily on pretrained object detectors or proposal-free frameworks that upgrade an off-the-shelf one-stage detector by fusing textual embeddings, our approach is built on top of a transformer encoder-decoder and is independent of any pretrained detectors or word embedding models. Termed VGTR -- Visual Grounding with TRansformers, our approach is designed to learn semantic-discriminative visual features under the guidance of the textual description without harming their location ability. This information flow enables our VGTR to have a strong capability in capturing context-level semantics of both vision and language modalities, rendering us to aggregate accurate visual clues implied by the description to locate the interested object instance. Experiments show that our method outperforms state-of-the-art proposal-free approaches by a considerable margin on five benchmarks while maintaining fast inference speed.

연구 동기 및 목표

  • 사전에 학습된 검출기에 의존하거나 맥락 모델링이 열악한 제안-랭킹 및 제안 없음 기반 시각적 기반 방법의 한계를 해결하기 위해.
  • 객체 검출기와 사전에 학습된 언어 모델에 종속되지 않는 엔드 투 엔드 시각적 기반 프레임워크를 개발하기 위해.
  • 새로운 주의 메커니즘을 통해 언어 의미에 의해 유도되는 구분 능력 있는 시각적 특징을 학습함으로써 정렬 정확도를 향상시키기 위해.
  • 이중 스트림 트랜스포머 아키텍처를 사용해 시각 및 언어 특징을 함께 추론함으로써 강력한 다중 모odal 이해를 가능하게 하기 위해.

제안 방법

  • VGTR는 네 모듈 아키텍처를 사용한다: 토큰화를 위한 시각적 및 텍스트 인코더, 다중 모달 상호작용을 위한 이중 스트림 기반 기반 인코더, 텍스트 토큰을 쿼리로 사용하는 기반 디코더, 그리고 경계 상자 회귀 헤드.
  • 핵심 혁신은 표준 자기주의를 대체하여 시각 스트림에서 시각적 특징을 언어 맥락과 정렬시키는 텍스트 유도형 자기주의 메커니즘으로, 공간 정렬 성능을 훼손하지 않으면서도 가능하다.
  • 모델은 이미지-텍스트 쌍에서 직접 물체 경계 상자 좌표를 회귀함으로써 엔드 투 엔드 학습을 수행하며, 후보 제안 생성이 필요 없도록 한다.
  • 시각적 및 텍스트적 특징 간의 교차 주의 메커니즘을 통해 공동 추론과 맥락 수준의 의미 정렬이 가능하다.
  • 기반 디코더는 쿼리에 관련된 시각적 토큰에 동적으로 주의를 기울이며, 언어 기술에 기반한 특징 표현을 개선한다.
  • 경계 상자 좌표에 대한 표준 회귀 손실을 사용해 엔드 투 엔드로 훈련되며, 이는 정렬 성능의 직접 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1사전에 학습된 객체 검출기나 언어 모델에 의존하지 않고도 트랜스포머 기반 시각적 기반 모델이 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ2텍스트 유도형 자기주의는 어떻게 언어 의미와 정렬된 시각적 특징 학습을 통해 시각적 특징 학습을 향상시키는가?
  • RQ3엔드 투 엔드, 제안 없음 기반 트랜스포머 프레임워크는 기존의 제안 없음 및 제안 기반 방법보다 시각적 기반에서 더 나은 성능을 내는가?
  • RQ4다중 모달 공동 추론은 복잡하거나 모호한 언어 기반 표현에서 정렬 정확도를 어느 정도 향상시키는가?

주요 결과

  • Flickr30K Entities에서 ResNet50를 사용한 VGTR는 ReSC-Large보다 정확도에서 4.89% 향상되어 가장 강력한 제안 없음 기반 베이스라인에 비해 뚜렷한 향상을 보였다.
  • RefCOCO에서 ResNet101을 사용한 VGTR는 검증 세트에서 78.70%의 정확도를 기록했으며, 검증 세트에서 ReSC-Large보다 1.67% 높고, 테스트B 세트에서는 2.08% 높았다.
  • 제거 실험 결과 텍스트 유도형 자기주의가 핵심임을 확인했으며, RefCOCO에서 정확도가 79.24%에서 82.09%로 상승하여 맥락 인식 특징 학습에서의 효과를 입증했다.
  • N=2 레이어를 가진 모델이 최적의 성능을 보였으며, 이는 특정 깊이를 초과하면 수익 감소가 발생함을 시사하며, N=2를 기본 설정으로 선택했다.
  • 정성 분석 결과 VGTR는 배경 객체, 눈에 띄지 않는 인스턴스, 복잡한 장면 내 객체를 정확히 정렬하는 데 뛰어나며, 이는 이전 모델이 실패하는 경우에 해당한다.
  • 실패 사례는 주로 부정('not')의 해석 오류에서 기인하며, 언어 내 논리적 부정 이해의 한계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.