Skip to main content
QUICK REVIEW

[논문 리뷰] RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning

Xiaojian Ma, Weili Nie|arXiv (Cornell University)|2022. 04. 24.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 개념-기능 사전을 도입하여 개념 유도 전역 및 국소 보조 작업을 가능하게 하는 개념 유도 뷰어션 트랜스포머(Concept-guided Vision Transformer)인 RelViT을 제안한다. 이는 시각적 상관계리닝을 향상시키며, HICO 및 GQA 벤치마크에서 성능을 크게 향상시킨다. 원래 분할에서는 각각 16%와 13%의 성능 향상을 기록했고, 체계적 일반화 분할에서는 각각 43%와 18%의 성능 향상을 기록한다.

ABSTRACT

Reasoning about visual relationships is central to how humans interpret the visual world. This task remains challenging for current deep learning algorithms since it requires addressing three key technical problems jointly: 1) identifying object entities and their properties, 2) inferring semantic relations between pairs of entities, and 3) generalizing to novel object-relation combinations, i.e., systematic generalization. In this work, we use vision transformers (ViTs) as our base model for visual reasoning and make better use of concepts defined as object entities and their relations to improve the reasoning ability of ViTs. Specifically, we introduce a novel concept-feature dictionary to allow flexible image feature retrieval at training time with concept keys. This dictionary enables two new concept-guided auxiliary tasks: 1) a global task for promoting relational reasoning, and 2) a local task for facilitating semantic object-centric correspondence learning. To examine the systematic generalization of visual reasoning models, we introduce systematic splits for the standard HICO and GQA benchmarks. We show the resulting model, Concept-guided Vision Transformer (or RelViT for short) significantly outperforms prior approaches on HICO and GQA by 16% and 13% in the original split, and by 43% and 18% in the systematic split. Our ablation analyses also reveal our model's compatibility with multiple ViT variants and robustness to hyper-parameters.

연구 동기 및 목표

  • 실세계 데이터셋에서의 체계적 일반화 문제를 해결한다.
  • 개념(물체와 관계)을 인덕티브 바이어스로 활용하여 비전 트랜스포머 성능을 향상시킨다.
  • 아키텍처 수정 없이도 더 나은 물체 중심 및 관계 기반 표현 학습을 가능하게 한다.
  • 기존 ViT 훈련 파이프라인과 호환되는 플러그 앤 플레이 프레임워크를 개발하여 더 나은 추론 성능을 확보한다.
  • HICO 및 GQA에 대한 새로운 체계적 분할을 사용하여 새로운 물체-관계 조합에 대한 일반화 성능을 평가한다.

제안 방법

  • 개념(예: 물체 레이블)을 키로, 해당 개념을 공유하는 이미지 특징의 큐를 값으로 가지는 개념-기능 사전을 도입한다.
  • 훈련 중에 개념 기반의 탄력적인 이미지 특징 검색을 가능하게 하기 위해 사전을 활용한다.
  • 같은 개념을 가진 이미지를 클러스터링하는 전역 개념 유도 작업을 설계하여 의미적으로 일관된 관계 표현을 촉진한다.
  • 같은 개념에 대해 이미지 간의 의미적 대응 관계를 학습하는 국소 개념 유도 작업을 설계하여 물체 중심 학습을 강화한다.
  • 전체 특징 큐 업데이트를 위해 지수 이동 평균(Exponential Moving Average, EMA)을 사용하여 두 보조 작업을 ViT 훈련 파이프라인에 통합한다.
  • 아키텍처 수정 없이 표준 ViT 백본에 적용 가능하여 즉시 사용 가능한 플러그 앤 플레이 배포를 가능하게 한다.

실험 결과

연구 질문

  • RQ1개념 유도 보조 작업이 비전 트랜스포머에서 시각적 상관계리닝을 향상시키는 데 기여하는가?
  • RQ2개념-기능 사전이 더 나은 특징 검색 및 표현 학습을 어떻게 가능하게 하는가?
  • RQ3제안된 방법이 실세계 시각적 추론 벤치마크에서 체계적 일반화 성능을 어느 정도 향상시키는가?
  • RQ4다양한 ViT 변종에서 성능 및 강건성 측면에서 이전 접근 방식과 비교해 RelViT는 어떻게 성능을 내는가?
  • RQ5아키텍처 수정 없이도 표준 벤치마크인 HICO 및 GQA에 효과적으로 적용 가능한가?

주요 결과

  • RelViT는 원래 HICO 벤치마크 분할에서 최고의 베이스라인 대비 16%의 절대 성능 향상을 기록했다.
  • HICO의 새로운 체계적 일반화 분할에서 RelViT는 최고의 베이스라인 대비 43%의 성능 향상을 기록했다.
  • 원래 GQA 벤치마크 분할에서 RelViT는 최고의 베이스라인 대비 13%의 성능 향상을 기록했다.
  • GQA의 체계적 일반화 분할에서 RelViT는 최고의 베이스라인 대비 18%의 성능 향상을 기록했다.
  • 제거 분석 결과, 전역 및 국소 보조 작업 모두 성능 향상에 기여하는 것으로 확인되었다.
  • 이 방법은 여러 가지 ViT 변종과 강한 호환성을 보이며, 하이퍼파라미터 설정에 대해 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.