Skip to main content
QUICK REVIEW

[논문 리뷰] GTNet:Guided Transformer Network for Detecting Human-Object Interactions

Adnan Iftekhar, Satish Kumar|arXiv (Cornell University)|2021. 08. 02.
Multimodal Machine Learning Applications참고 문헌 60인용 수 4
한 줄 요약

GTNet는 상대적 공간적 구성과 객체 의미를 융합하여 자기주의 주의 메커니즘을 안내하는 가이드된 트랜스포머 네트워크를 제안하며, 더 나은 문맥적 특징 인코딩을 통해 V-COCO (58.29 mAP) 및 HICO-DET 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The human-object interaction (HOI) detection task refers to localizing humans, localizing objects, and predicting the interactions between each human-object pair. HOI is considered one of the fundamental steps in truly understanding complex visual scenes. For detecting HOI, it is important to utilize relative spatial configurations and object semantics to find salient spatial regions of images that highlight the interactions between human object pairs. This issue is addressed by the novel self-attention based guided transformer network, GTNet. GTNet encodes this spatial contextual information in human and object visual features via self-attention while achieving state of the art results on both the V-COCO and HICO-DET datasets. Code will be made available online.

연구 동기 및 목표

  • 공간적 맥락과 객체 의미를 효과적으로 활용하여 인간-객체 상호작용 검출을 향상시키는 것.
  • 기존 방법이 HOI 예측을 위한 관련 공간적 맥락을 인코딩하는 데에 한계를 가진다는 문제를 해결하는 것.
  • Transformer의 자기주의 주의를 위한 시각적 관계 검출에 특화된 새로운 안내 메커니즘을 개발하는 것.
  • 표준 HOI 벤치마크 데이터셋인 V-COCO 및 HICO-DET에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • GTNet는 입력 이미지와 인간/객체 바운딩 박스에서 시각적 특징을 추출하기 위해 백본 네트워크를 사용한다.
  • 가이드 모듈은 상대적 공간적 구성과 객체 의미(단어 임베딩를 통해)를 결합하여 주의의 쿼리 벡터를 생성한다.
  • TX 모듈은 가이드된 쿼리를 사용하여 트랜스포머 기반 자기주의 주의 메커니즘을 적용하여 시각적 특징에 공간적 맥락을 강화한다.
  • 네트워크는 특징을 융합하고 상호작용을 예측하기 위해 초기 융합 전략을 사용한다.
  • 가이드 메커니즘은 공간적 및 의미적 특징의 연결 또는 원소별 곱셈을 통해 주의 쿼리를 정밀하게 조정한다.
  • 64×64 크기의 학습 가능한 공간 맵을 사용하여 상대적 공간 레이아웃을 인코딩하고, 1×1 컨볼루션을 통해 512채널의 키와 밸류를 생성하여 최적의 성능을 달성한다.
Figure 1: GTNet’s performance with and without its guidance mechanism. Blue indicates GTNet’s predictions with the guidance mechanism; red indicates without. Green bounding boxes indicate the human under consideration; yellow boxes indicate the object. Left column: Simple Scenarios (higher confidenc
Figure 1: GTNet’s performance with and without its guidance mechanism. Blue indicates GTNet’s predictions with the guidance mechanism; red indicates without. Green bounding boxes indicate the human under consideration; yellow boxes indicate the object. Left column: Simple Scenarios (higher confidenc

실험 결과

연구 질문

  • RQ1공간적 및 의미적 맥락을 더 효과적으로 인코딩함으로써 가이드된 자기주의 주의가 HOI 검출 성능을 향상시킬 수 있는가?
  • RQ2객체 의미와 상대적 공간 레이아웃을 결합함으로써 주의 기반 특징 정밀도 향상에 어떤 영향을 미치는가?
  • RQ3특화된 가이드 메커니즘이 상호작용을 위한 중요한 공간적 맥락을 포착하는 데 있어 표준 주의 메커니즘을 초월하는가?
  • RQ4가이드 메커니즘의 공간 맵 크기와 특징 차원 수의 최적 구성은 무엇인가?

주요 결과

  • GTNet는 V-COCO 테스트 세트에서 평균 정밀도(mAP) 58.29를 기록하여 새로운 최신 기술 수준을 수립했다.
  • 가이드 메커니즘이 포함된 경우 성능이 6 mAP 이상 향상되어 그 핵심적인 역할을 입증했다.
  • 의미적 가이드만으로도 공간적 가이드보다 성능이 뛰어나, 객체 카테고리 정보가 공간 레이아웃 정보만으로는 더 효과적임을 시사한다.
  • 가이드에 원소별 곱셈을 사용할 경우(58.29 mAP) 연결을 사용할 경우(57.02 mAP)보다 더 좋은 성능을 기록하여 쿼리 정밀도 향상이 확인되었다.
  • 키 및 밸류의 채널 수(최대 512)와 공간 맵 크기(최대 64×64)를 증가시키면 성능 향상이 이루어지며, GPU 메모리 제약 조건 하에서 64×64와 512채널이 선택되었다.
  • 정성적 결과는 GTNet가 복잡한 시나리오에서도 상호작용을 정확히 식별하고, 클래스 활성 맵을 통해 관련된 공간적 맥락을 잘 강조함을 보여준다.
Figure 2: Model Overview. We extract human and object feature vectors from the input feature map, $\mathbf{F}$ via two RRG operations. For clarity we do not explicitly show two separate RRG operations. Human and object features are used to generate a query vector, $\mathbf{f}_{Q}$ . Before feeding $
Figure 2: Model Overview. We extract human and object feature vectors from the input feature map, $\mathbf{F}$ via two RRG operations. For clarity we do not explicitly show two separate RRG operations. Human and object features are used to generate a query vector, $\mathbf{f}_{Q}$ . Before feeding $

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.