Skip to main content
QUICK REVIEW

[논문 리뷰] Look Before You Leap: Learning Landmark Features for One-Stage Visual Grounding

Binbin Huang, Dongze Lian|arXiv (Cornell University)|2021. 04. 09.
Multimodal Machine Learning Applications참고 문헌 32인용 수 9
한 줄 요약

이 논문은 동적 최대 풀링 기반의 랜드마크 특징 컨볼루션 모듈를 사용하여 랜드마크 특징을 학습함으로써 국소화 성능을 향상시키는 일단계 시각 기반 모델인 LBYL-Net을 제안한다. 맥락 인식형 전역 수신장 특징을 통해 객체 간의 공간적 관계를 모델링함으로써 ReferitGame에서 최신 기준 성능(SOTA)을 달성하고 RefCOCO/RefCOCO+에서도 경쟁적인 결과를 내며, 추가 파rameter 없이 효율적이고 종단 간 훈련이 가능한 것으로 이전의 일단계 및 두 번째 단계 방법들을 능가한다.

ABSTRACT

An LBYL (`Look Before You Leap') Network is proposed for end-to-end trainable one-stage visual grounding. The idea behind LBYL-Net is intuitive and straightforward: we follow a language's description to localize the target object based on its relative spatial relation to `Landmarks', which is characterized by some spatial positional words and some descriptive words about the object. The core of our LBYL-Net is a landmark feature convolution module that transmits the visual features with the guidance of linguistic description along with different directions. Consequently, such a module encodes the relative spatial positional relations between the current object and its context. Then we combine the contextual information from the landmark feature convolution module with the target's visual features for grounding. To make this landmark feature convolution light-weight, we introduce a dynamic programming algorithm (termed dynamic max pooling) with low complexity to extract the landmark feature. Thanks to the landmark feature convolution module, we mimic the human behavior of `Look Before You Leap' to design an LBYL-Net, which takes full consideration of contextual information. Extensive experiments show our method's effectiveness in four grounding datasets. Specifically, our LBYL-Net outperforms all state-of-the-art two-stage and one-stage methods on ReferitGame. On RefCOCO and RefCOCO+, Our LBYL-Net also achieves comparable results or even better results than existing one-stage methods.

연구 동기 및 목표

  • 일단계 시각 기반 모델이 객체 간 장거리 맥락적 관계를 포착하는 데에 한계가 있음을 해결하기 위해.
  • 두 번째 단계 파이프라인을 통합된 경량 아키텍처로 대체하여 종단 간 훈련이 가능하고 실시간으로 작동하는 시각 기반 모델을 가능하게 하기 위해.
  • 언어에서 유도된 상대적 위치와 묘사적 특성 정보를 담은 랜드마크 특징을 사용하여 공간적 관계를 모델링하기 위해.
  • 파rameter가 없는 컨볼루션 모듈을 통해 격자 특징에 전역적이고 방향 인식형 맥락을 부여함으로써 국소화 정확도를 향상시키기 위해.
  • 사전 정의된 객체 카테고리 외의 맥락적 단서(예: '빨간 벽')가 기반화에 필수적이며 효과적으로 학습될 수 있음을 입증하기 위해.

제안 방법

  • LBYL-Net 프레임워크는 이미지에서 다중 척도 시각 특징을 추출하기 위해 특징 피라미드 네트워크(FPN)를 사용한다.
  • 공간적으로 관련성이 높은 영역에서 랜드마크 특징을 타겟 객체로 전파하기 위해 동적 최대 풀링(DMP)을 사용하는 랜드마크 특징 컨볼루션(LFC) 모듈를 도입한다.
  • DMP는 최적의 특징 집합 경로를 다양한 방향으로 계산하는 저복잡도의 동적 프로그래밍 알고리즘으로, 추가 파rameter 없이 전역 수신장과 방향 인식 기능을 제공한다.
  • 랜드마크 특징은 의미적 또는 공간적으로 두드러진 영역(예: ' browm chair', 'red wall')에서 추출되며, 굵은 특징 맵에서 최대 풀링을 통해 풀링된다.
  • 최종 특징 표현은 타겟 객체의 시각적 특징과 LFC 모듈로부터 유도된 맥락 강화 특징을 조합하여 공동 탐지 및 매칭을 수행한다.
  • 모델은 탐지 및 매칭 파라다임을 사용하여 종단 간 훈련되며, 인간의 '뛰기 전에 먼저 보는' 행동 방식을 모방하여 국소화 이전에 공간 맥락을 평가한다.

실험 결과

연구 질문

  • RQ1영역 제안 없이도 일단계 시각 기반 모델이 객체 간 장거리 공간적 관계를 효과적으로 모델링할 수 있는가?
  • RQ2랜드마크 특징을 효율적으로 추출하고 집계하여 국소화 정확도를 향상시키면서도 계산 비용을 낮출 수 있는가?
  • RQ3배경 측면의 맥락(예: '벽' 또는 '테이블')과 같은 비객체 엔티티에서 유도된 맥락 정보를 통합하면 기반화 성능이 향상되는가?
  • RQ4제안된 동적 최대 풀링(DMP)은 장거리 컨볼루션, 변형 가능 컨볼루션, Non-Local 네트워크와 비교해 공간 맥락을 모델링하는 데 어떻게 성능을 내는가?
  • RQ5동적 최대 풀링 과정에서의 파artition 수(P)가 모델 성능에 얼마나 영향을 미치는가?

주요 결과

  • ReferitGame에서 LBYL-Net은 IoU 임계값 0.5에서 정밀도 65.48% (Pr@0.5)를 달성하여 이전의 모든 일단계 및 두 번째 단계 방법들을 능가한다.
  • 제거 분석 결과, 랜드마크 특징 컨볼루션(LFC)이 성능 향상에 가장 기여하며, IoU 0.75 기준으로 BFPN 및 FiLM 대비 3% 이상의 Pr@0.5 향상을 이룬다.
  • 동적 최대 풀링에서 P=4일 경우 성능가 포화 상태에 도달함을 확인하여, ReferitGame 데이터셋에서 방향성 맥락을 포착하기 위해 네 개의 공간 파artition이 충분함을 시사한다.
  • P=8일 경우 65.58%의 Pr@0.5를 기록하며, 더 이상의 파artition 분할이 유의미한 성능 향상을 가져오지 못함을 확인함으로써, 데이터셋 특성에 기인한 제약이 존재할 것임을 시사한다.
  • 시각화 결과, 랜드마크 특징이 '빨간 벽'이나 ' browm 의자'와 같이 사전 정의된 객체가 아닐지라도 의미적으로 관련된 단서에 집중함을 확인하였다.
  • LFC 모듈은 가우시안 임bedded Non-Local, 커널 크기 3인 변형 가능 컨볼루션, 확장도 3인 장거리 컨볼루션보다 뛰어난 성능을 보이며, 전역 맥락과 낮은 복잡도를 갖는 공간 관계 모델링에서의 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.